HyperAIHyperAI

Command Palette

Search for a command to run...

이모티콘으로 음성 생성을 제어할 수 있을까요? Irodori-TTS는 RF-DiT 아키텍처 기반의 일본어 TTS입니다. 습진 및 백선 피부 질환 데이터 세트: 의료 영상 분류 및 전이 학습을 지원합니다.

Featured Image

2026년 개발자 아라타코가 공개한 오픈 소스 프로젝트인 이로도리-TTS는 고음질과 뛰어난 조작성을 결합한 차세대 일본어 음성 합성 및 제로샷 클로닝 모델입니다.핵심 모델인 Irodori-TTS-500M-v3는 5억 개의 파라미터를 갖추고 있으며, 연속 DACVAE 잠재 공간과 RF-DiT 아키텍처를 기반으로 하여 연산 효율성을 보장하면서 48kHz에서 전문가급 오디오를 안정적으로 출력할 수 있습니다.실제 적용에서 이 모델은 두 가지 주요 혁신을 이루었습니다. 첫째, 사용자가 3~10초 분량의 참조 오디오만 제공하면 미세 조정 없이 목표 음색을 정확하게 복제할 수 있는 매우 빠른 "제로 샘플 음성 복제"를 가능하게 합니다. 둘째, 혁신적인 이모지 주석과 자동 지속 시간 예측을 결합하여 감정, 어조 및 미묘한 비언어적 표현을 세밀하게 조정할 수 있는 "다차원 스타일 제어"를 가능하게 합니다.

HyperAI 웹사이트에서 "Irodori-TTS-500M-v3: 일본어 음성 합성 및 이모지 스타일 제어"를 만나보세요! 한번 사용해 보세요!

온라인 사용:https://go.hyper.ai/pFPM5

6월 27일부터 7월 3일까지 hyper.ai 웹사이트에 적용된 주요 업데이트 사항을 간략하게 살펴보겠습니다.

* 고품질 공개 데이터 세트: 4개

* 엄선된 고품질 튜토리얼: 12개

* 커뮤니티 게시글 분석: 게시글 1개

* 인기 백과사전 항목: 5개

공식 웹사이트를 방문하세요:하이퍼.AI

선택된 공개 데이터 세트

1. 습진 및 백선 피부 질환 데이터 세트

습진 및 백선 피부 질환 데이터셋은 습진과 백선 피부 질환에 대한 의료 영상 데이터셋입니다. 이 데이터셋은 이진 영상 분류 작업에 보다 간결하고 실용적인 데이터 지원을 제공하는 것을 목표로 하며, 피부 질환 영상 분류, 딥러닝 모델 학습 및 평가, 퓨샷(few-shot) 및 전이 학습 연구, 의료 영상 분석 교육 및 실험 등 다양한 분야에서 널리 활용되고 있습니다. 데이터셋에는 2,147개의 피부 질환 영상이 포함되어 있습니다.

온라인 사용:https://go.hyper.ai/nheob

데이터 세트 예제

2. SASH-VPV 피하 손바닥 정맥 인식 데이터 세트

SASH-VPV는 생체 인식 및 컴퓨터 비전 연구를 위한 근적외선 손바닥 정맥 생체 인식 벤치마크 데이터셋입니다. 손바닥 피하 정맥 구조의 신원 인증 연구를 목표로 하며, 생체 인식 시스템 개발, 딥러닝 모델 학습, 세션 간 안정성 연구 등에 널리 활용됩니다.

온라인 사용:https://go.hyper.ai/B9xrr

데이터 세트 예제

3. 궁극의 애니메이션 등급 및 분류 데이터 세트

2026년에 출시된 Ultimate Anime은 애니메이션 추천 시스템 구축, 탐색적 데이터 분석(EDA) 데이터 시각화, 애니메이션 업계의 장기적인 추세 및 인기 비교 분석을 지원하기 위해 설계된 애니메이션 평점 및 분류 데이터셋입니다. 이 데이터셋은 애니메이션 데이터베이스인 AniList와 MyAnimeList에서 가져온 3,994개의 애니메이션 작품 데이터를 포함하며, 제목, 장르, AniList 커뮤니티 평점, 총 에피소드 수, 방영 여부, 연도, 줄거리, 제작사, 원작, 인기 및 순위, 표지 이미지, 방영 시간 등 다양한 차원의 정보를 담고 있습니다.

온라인 사용:https://go.hyper.ai/tXtT5

4. 장미 잎 질병 데이터 세트

장미 잎 질병 데이터셋은 장미 잎 질병 탐지 모델 개발 및 벤치마킹을 위한 고품질 이미지 데이터를 제공하기 위해 설계되었으며, 식물 모니터링 시스템 구축에 널리 사용됩니다. 이 데이터셋의 원본 버전은 방글라데시에서 수집된 2,458개의 장미 잎 이미지로 구성되어 있으며, 검은점병, 노균병, 잎마름병, 정상 잎, 해충 피해 등 다섯 가지 유형으로 분류됩니다.

온라인 사용:https://go.hyper.ai/IuPUO

데이터 세트 예제

선택된 공개 튜토리얼

1. Irodori-TTS-500M-v3: 일본어 음성 합성 및 이모지 스타일 제어

2026년 5월 개발자 아라타코가 공개한 이로도리-TTS 프로젝트는 일본어 텍스트 음성 변환, 제로 샘플 음성 복제, 이모티콘 기반 음성 스타일 제어 기능을 제공합니다. 이 프로젝트의 혁신은 정류 전류 확산 변압기(RF-DiT)를 사용하여 연속적인 DACVAE 잠재 공간에서 48kHz 음성을 생성하고, 기준 오디오 조건, 자동 지속 시간 예측, 이모티콘의 미묘한 차이를 활용하여 음색, 감정, 비언어적 표현을 제어하는 데 있습니다. 

온라인으로 실행:https://go.hyper.ai/pFPM5

데모 페이지

2. MatAnyone 2 비디오 키잉 모델

난양공과대학교 S-Lab과 SenseTime이 2026년에 출시한 MatAnyone 2 프로젝트는 비디오에서 캐릭터 배경 제거, 전경 추출 및 알파 마스킹에 사용됩니다. 이 프로젝트의 혁신은 자체 개발한 품질 평가 도구를 통해 안정적인 배경 제거, 이미지 경계 아티팩트 제거, 머리카락 디테일의 정확한 보존, 그리고 여러 캐릭터에 대한 특정 배경 제거 기능을 구현하는 데 있습니다.

온라인으로 실행:https://go.hyper.ai/yNeFK

데모 페이지

3. 인스페이시오-월드: 실시간 4D 세계 시뮬레이터

InSpatio-World는 InSpatio 팀에서 2026년 3월 19일에 출시한 시공간 자기회귀 모델링 기반의 실시간 4D 세계 시뮬레이터입니다. 입력 영상과 지정된 카메라 궤적을 기반으로 안정적이고 제어 가능한 새로운 시점의 영상을 생성하여 카메라 경로를 자유롭게 제어하고 시간에 따라 세계가 진화하는 모습을 구현합니다.

온라인으로 실행:https://go.hyper.ai/8FRRy

데모 페이지

4. DiaMoE-TTS: IPA 기반 다중 방언 음성 합성 튜토리얼

2025년 9월 Giant AI Lab에서 시작된 DiaMoE-TTS 프로젝트는 국제 음성 기호(IPA)를 통합 프런트엔드로 사용하여 다중 방언 음성 합성을 지원합니다. 이 프로젝트의 혁신은 방언별 전문 지식을 전문가 혼합(MoE) 라우팅에 통합하고 LoRA/Conditioning Adapter와 같은 효율적인 파라미터 방식을 통해 샘플 없이 새로운 방언에 빠르게 적응하는 데 있습니다.

온라인으로 실행:https://go.hyper.ai/wn9i5

데모 페이지

5. SAM-Audio: 자연어 처리를 사용하여 오디오에서 임의의 소리를 분리합니다.

SAM-Audio는 Meta에서 2025년 12월에 출시한 기본 오디오 소스 분리 모델입니다. 이 모델은 자연어 설명, 비디오 시각적 단서 또는 시간 구간과 같은 방법을 사용하여 복잡한 오디오 혼합물에서 특정 소리를 분리할 수 있습니다.

온라인으로 실행:https://go.hyper.ai/svjXe

데모 페이지

6. PrismAudio: CoT 분해 및 다차원 보상 기반 V2A

PrismAudio는 2025년 11월 Tongyi Labs에서 출시한 비디오-오디오(V2A) 변환 모델입니다. 이 모델은 ThinkSound의 사고 연쇄(Chain of Thought, CoT) 계획 메커니즘을 기반으로 강화 학습을 V2A 변환에 도입한 최초의 프레임워크입니다. PrismAudio는 단일 추론 과정을 의미론적, 시간적, 미학적, 공간적이라는 네 가지 특화된 CoT 모듈로 분해하고, 각 모듈에 목표 보상 함수를 부여하여 다차원 강화 학습 최적화를 달성하고 모든 지각적 차원에서 추론 품질을 종합적으로 향상시킵니다.

온라인으로 실행:https://go.hyper.ai/BRGSk

데모 페이지

7. DreamOmni2: 멀티모달 명령어 기반 이미지 편집 및 생성

DreamOmni2는 홍콩중문대학교 JIA 연구실에서 2025년 10월에 발표한 멀티모달 명령어 기반 이미지 편집 및 생성 모델입니다. 이 논문은 CVPR 2026의 주요 논문으로 선정되었습니다. DreamOmni2는 FLUX.1-Kontext-dev 기본 모델을 기반으로 하며, 정교하게 튜닝된 Qwen2.5-VL-7B 시각 언어 모델과 결합하여 자연어 명령어와 참조 이미지를 통해 이미지 편집 및 생성을 지원합니다.

온라인으로 실행:https://go.hyper.ai/1iqNO

데모 페이지

8. PixelRefer: 이미지와 비디오의 세밀한 객체 이해를 위한 통합 프레임워크.

2025년 10월 알리바바 다모 아카데미에서 출시된 PixelRefer는 이미지와 비디오에서 정밀한 객체 중심 식별, 캡션 생성 및 질문 답변 기능을 제공하는 것을 목표로 합니다. 이 기술의 혁신성은 통합된 영역 수준 다단계 선형 모델 프레임워크(MLLM)와 크기 적응형 객체 분할기(SAOT), 그리고 효율적인 PixelRefer-Lite 객체별 프레임워크를 결합하여 간결한 객체 표현을 구축하는 데 있습니다.

온라인으로 실행:https://go.hyper.ai/ETjjw

데모 페이지

9. 무제한 OCR: 긴 문서의 OCR 및 레이아웃 분석을 한 번의 클릭으로 실행

Unlimited-OCR 프로젝트는 바이두 팀에서 2026년 6월에 출시되었습니다. 이 프로젝트는 장문 문서 OCR 및 레이아웃 분석 시나리오를 목표로 하며, 핵심 목표는 긴 컨텍스트 내에서도 안정적인 분석 효율을 유지하고, 한 번에 장시간 분석을 완료하는 것입니다. 이 모델은 단일 문서 이미지, 여러 페이지로 구성된 이미지, PDF에서 변환된 페이지 이미지 등을 처리할 수 있어 논문, 보고서, 스캔 문서, 긴 표, 여러 페이지로 구성된 문서 등의 텍스트 인식 및 구조적 분석에 적합합니다.

온라인으로 실행:https://go.hyper.ai/Bp69q

데모 페이지

10. EdgeTAM: 엣지 디바이스를 위한 단서 기반 이미지 및 비디오 분할 모델.

2025년 1월 Meta Reality Labs와 난양공과대학교 S-Lab이 공동으로 시작한 EdgeTAM 프로젝트는 리소스가 제한된 기기에서 단서를 활용한 이미지 분할 및 비디오 객체 추적 작업을 위해 설계되었습니다. 이 프로젝트의 핵심 혁신은 2D 공간 퍼셉트론과 증류 과정을 결합하여 SAM 2의 메모리 어텐션 병목 현상을 줄이면서도 분할 품질을 유지함으로써 기기 내에서 효율적인 "무엇이든 추적" 상호 작용을 가능하게 하는 것입니다.

온라인으로 실행:https://go.hyper.ai/yZoqO

데모 페이지

11. Step-Audio-EditX: 3B LLM 기반의 제로샷 음성 복제 및 표현 기반 오디오 편집

StepFun에서 2025년 11월에 공개한 Step-Audio-EditX 프로젝트는 제로샷 음성 복제 및 반복적이고 표현력 풍부한 오디오 편집 작업을 목표로 합니다. 이 프로젝트의 혁신은 30억 개의 매개변수를 가진 대규모 언어 모델과 강화 학습을 결합하여 감정, 발화 스타일, 비언어적 현상을 조합 가능한 개별 제어 항으로 구현한 데 있습니다. 이 모델은 중국어, 영어, 쓰촨어, 광둥어, 일본어, 한국어를 지원합니다.

온라인으로 실행:https://go.hyper.ai/UL7Hg

데모 페이지

12. Nemotron 3.5 ASR Streaming 0.6B: 스트리밍 음성 인식을 위한 경량 ASR 모델

Nemotron 3.5 ASR Streaming 0.6B는 NVIDIA에서 2026년 6월에 출시한 6천만 개의 파라미터를 지원하는 자동 음성 인식 및 저지연 스트리밍 전사 모델입니다. 이 모델은 캐시 인식 FastConformer-RNNT 아키텍처를 사용하여 스트리밍 추론 중에 인코더 컨텍스트를 재사용함으로써 중복 계산을 줄입니다. 또한 언어 ID 큐잉 조건을 지원하여 여러 언어 지역에 걸쳐 전사 작업을 수행할 수 있습니다.

온라인으로 실행:https://go.hyper.ai/mFejg

데모 페이지

커뮤니티 기사 해석

1. Meta는 AI 데이터 과학자를 추천하고, Autodata는 고품질 학습/평가 데이터 세트를 구축합니다.

메타 기초 인공지능 연구팀은 지능형 에이전트가 "데이터 과학자" 역할을 수행하며 데이터를 구축하고 정리하는 일반적인 방법인 '오토데이터(Autodata)'를 제안했습니다. 이 에이전트는 인간 데이터 과학자의 작업 과정을 모방하여 고품질 데이터를 생성합니다. 이 과정에는 초기 데이터 생성뿐만 아니라 데이터 분석, 성능 평가, 경험 요약, 그리고 이러한 경험을 바탕으로 더 나은 데이터 솔루션을 반복적으로 생성하는 단계까지 포함됩니다.

전체 보고서 보기:https://go.hyper.ai/UThkc

인기 백과사전 기사

1. 대규모 언어 모델(LLM)

2. 세계행동모델(WAM)

3. 조화평균

4. 온라인 상영회

5. AI 피드백 기반 강화 학습(RLAIF)

다음은 "인공지능"을 이해하는 데 도움이 되는 수백 가지 AI 관련 용어입니다.

https://go.hyper.ai/wiki

위에 적힌 내용은 이번 주 편집자 추천 기사의 전체 내용입니다. hyper.ai 공식 웹사이트에 포함시키고 싶은 리소스가 있다면, 메시지를 남기거나 기사를 제출해 알려주세요!

다음주에 뵙겠습니다!

HyperAI 소개

HyperAI(hyper.ai)는 중국을 선도하는 인공지능 및 고성능 컴퓨팅 커뮤니티입니다.우리는 중국 데이터 과학 분야의 인프라가 되고 국내 개발자들에게 풍부하고 고품질의 공공 리소스를 제공하기 위해 최선을 다하고 있습니다. 지금까지 우리는 다음과 같습니다.

* 2100개 이상의 공개 데이터 세트에 대한 국내 가속 다운로드 노드를 제공합니다.

* 700개 이상의 고전 및 인기 온라인 강좌가 포함되어 있습니다.

* 300개 이상의 AI4Science 논문 사례 분석

* 700개 이상의 관련 용어 검색을 지원합니다.

* 중국에서 최초의 완전한 Apache TVM 중국어 문서 호스팅

학습 여정을 시작하려면 공식 웹사이트를 방문하세요.

https://hyper.ai