주요 콘텐츠로 건너뛰기

IndexTTS-2.5 운영 중

IndexTTS-2.5는 Bilibili가 오픈 소스로 공개한 산업级 제로샷 음성 복제 모델로, 매개변수规模는仅 0.8B이며 중국어, 영어, 일본어, 스페인어, 아랍어 5개 언어 간 음성 전이를 지원합니다.

IndexTTS-2.5는 Bilibili가 오픈 소스로 공개한 산업级 제로샷 음성 복제 모델로, 매개변수规模는仅 0.8B이며 중국어, 영어, 일본어, 스페인어, 아랍어 5개 언어 간 음성 전이를 지원합니다.

IndexTTS-2.5 제품 인터페이스
월간 방문 수
0
가격
무료 및 유료
등록일
2026-08-12
업데이트됨
2026-08-12

01IndexTTS-2.5란 무엇인가

IndexTTS-2.5는 Bilibili가 오픈 소스로 공개한 산업级 제로샷 음성 복제 모델로, 매개변수 규모는 0.8B에 불과하며 중국어, 영어, 일본어, 스페인어, 아랍어 5개 언어 간 음성 전이를 지원합니다. 모델은 추론 아키텍처를 재구성해 추론 속도를 2.28배 향상했으며, 0.5x부터 2.0x까지의 음성 속도 조절과 발음, 감정 등의 세밀한 제어를 지원합니다. 전체 코드, 모델 가중치 및 논문이 모두 공개되었으며 Bilibili Model License를 따릅니다.

02IndexTTS-2.5의 주요 기능

제로샷 음성 복제: 3~10초 길이의 참조 오디오만으로도 화자의 음색 특징을 정밀하게 복제할 수 있으며, 대상 화자에 대한 추가 학습이 필요하지 않습니다.
5개 언어 및 언어 간 지원: 중국어, 영어, 일본어, 스페인어, 아랍어를 지원합니다.
세밀한 감정 제어: 독립적인 감정 참조 오디오로 감정을 전달하고, 8차원 감정 벡터로 감정 강도를 정확히 지정하며, 텍스트 기반 감정 자동 추론을 활성화하거나 emo_alpha 매개변수로 감정의 강약을 조절하는 등 다양한 감정 조절 방식을 제공합니다.
음색과 감정의 분리: 음색 프롬프트 오디오와 감정 프롬프트 오디오를 완전히 독립적으로 지정할 수 있습니다. 사용자는 “누가 말하는지”와 “어떻게 말하는지”를 각각 제어할 수 있습니다.
음성 속도 무단계 조절: duration_factor 매개변수를 통해 0.5배에서 2.0배 사이로 합성 음성의 속도를 자유롭게 조절하여 다양한 상황의 리듬 요구를 충족합니다.
정밀한 발음 제어: 중국어 병음, 영어 CMU 음소, 일본어 가나의 세 가지 단위로 발음을 제어할 수 있어 다중 발음 한자, 이독어 및 문맥 의존적 발음 문제를 효과적으로 해결합니다.

03IndexTTS-2.5의 기술 원리

WeChat에서 팔로우 후 “오픈 소스”라고 답장하여 AI 오픈 소스 프로젝트交流群에 참여하세요.
3단계 생성 파이프라인: 모델은 “텍스트 → 시맨틱 Token → 멜 스펙트럼 → 파형”의 3단계 아키텍처를 사용합니다. Transformer 기반 텍스트-시맨틱(T2S) 언어 모델이 시맨틱 Token을 생성하고, 비자기회귀 방식의 시맨틱-멜 스펙트럼(S2M) 플로 매칭 모듈이 멜 스펙트로그램을 생성한 뒤, 신경 보코더를 통해 최종 오디오로 복원합니다.
시맨틱 코덱 압축: 시맨틱 Token의 프레임률을 50Hz에서 25Hz로 압축하여 시퀀스 길이를 절반으로 줄이고, 학습 및 추론 시 T2S 모듈의 연산량과 메모리 사용량을 크게 낮춥니다. 이는 추론 가속의 핵심 요소 중 하나입니다.
Zipformer 아키텍처 업그레이드: S2M 모듈의 백본 네트워크를 U-DiT에서 더욱 효율적인 Zipformer 아키텍처로 교체했습니다. Zipformer는 더 적은 매개변수로 더욱 강력한 장기 의존성 모델링 능력을 구현하여 멜 스펙트럼을 더 빠르고 안정적으로 생성하면서도 합성 음질을 유지합니다.
다국어 모델링 전략: 다국어 환경에서 문자 중복으로 발생하는 혼동 문제를 해결하기 위해 팀은 세 가지 전략을 제안했습니다. 경계 인식 정렬(텍스트 앞뒤에 와 같은 언어 표식을 삽입), Token 수준 결합(각 입력 Token에 언어별 임베딩을 결합), 지시문 유도 생성(텍스트 앞에 “영어로 읽어 주세요”와 같은 자연어 지시문 접두사를 추가)입니다.
GRPO 강화학습 최적화: T2S 모듈의 후학습 단계에 GRPO(Group Relative Policy Optimization)를 도입하고, 동결된 ASR 모델의 단어 오류율(WER)을 보상 신호로 사용합니다. 매번 4개의 후보 샘플을 생성한 후 보상이 높은 샘플의 상대 우도를 최적화하여 발음 정확도와 음성 자연스러움을 지속적으로 향상합니다.

04IndexTTS-2.5 사용 방법

환경 준비: 먼저 Git과 uv 패키지 관리자를 설치한 뒤, git clone https://github.com/index-tts/index-tts.git 명령으로 공식 코드 저장소를 로컬에 다운로드합니다.
종속성 설치: 프로젝트 디렉터리로 이동한 후 uv sync --all-extras 명령을 실행하여 가상 환경을 자동으로 생성하고 필요한 모든 Python 종속성을 설치합니다.
모델 다운로드: huggingface-cli 또는 modelscope 도구를 사용하여 공식 저장소 IndexTeam/IndexTTS-2.5에서 모델 가중치를 로컬 checkpoints 디렉터리로 다운로드합니다.
웹 인터페이스 시작: uv run webui.py를 실행하여 Gradio 대화형 인터페이스를 시작하고, 브라우저에서 http://127.0.0.1:7860에 접속해 시각적인 음성 합성 작업을 수행합니다.
모델 로드: Python 스크립트에서 indextts.infer_v2_5로부터 IndexTTS2 클래스를 가져온 뒤 구성 파일 경로와 모델 디렉터리를 전달하여 모델 인스턴스를 생성합니다.
기본 음성 복제: 인스턴스의 infer 메서드에 참조 오디오 경로, 대상 텍스트, 언어 코드를 전달하면 복제된 음색의 음성 파일을 생성하고 저장할 수 있습니다.
감정 제어: infer 메서드에 emo_audio_prompt 매개변수를 추가로 전달하여 감정 참조 오디오를 지정하거나, emo_vector에 8차원 감정 벡터를 전달하여 합성 음성의 감정 표현을 제어할 수 있습니다.
음성 속도 조절: 추론 시 duration_factor 매개변수를 0.5에서 2.0 사이의 값으로 설정하면 비율에 따라 합성 음성의 속도를 높이거나 낮출 수 있습니다.
발음 제어: 입력 텍스트에 <行|XING2>, 또는 <上手|じょうず>와 같은 표기를 삽입하여 다중 발음 한자나 이독어의 발음을 정밀하게 제어할 수 있습니다.

05IndexTTS-2.5의 핵심 장점

적은参数로 높은 효율: 모델 매개변수 규모는 0.8B에 불과하며, 시맨틱 코덱 압축과 Zipformer 아키텍처 업그레이드를 통해 2.28배의 추론 가속을 구현했습니다. BF16 정밀도에서 실시간률(RTF)은 최저 0.20으로, 경량화와 고성능을 모두 실현합니다.
5개 언어 간 음성 전이: 중국어, 영어, 일본어, 스페인어, 아랍어를 지원합니다. 사용자는 어느 한 언어의 참조 오디오로 다른 언어의 음성을 복제할 수 있으며, 대상 언어의 감정 학습 데이터 없이도 언어 간 감정 전이를 구현할 수 있습니다.
다차원 세밀 제어: 0.5x~2.0x의 무단계 음성 속도 조절, 8차원 감정 벡터 제어, 텍스트 기반 감정 추론, 병음·CMU 음소·일본어 가나의 세 가지 단위에 대한 발음 제어를 지원하여 콘텐츠 제작의 세밀한 음성 합성 요구를 충족합니다.
음색과 감정의 완전한 분리: 사용자는 음색 프롬프트 오디오와 감정 프롬프트 오디오를 독립적으로 지정할 수 있으며, 두 오디오가 서로 다른 언어로 녹음되어도 됩니다. 이를 통해 대상 화자의 음색을 유지하면서 원하는 감정 스타일을 유연하게 주입할 수 있습니다.
아랍어 오픈 소스 지원: 주요 오픈 소스 TTS 모델 가운데 IndexTTS-2.5는 아랍어 음성 복제와 언어 간 전이를 완전히 지원하는 몇 안 되는 모델 중 하나로, 오픈 소스 음성 합성 분야에서 아랍어 지원의 공백을 메웠습니다.

06IndexTTS-2.5 프로젝트 주소

GitHub 저장소: https://github.com/index-tts/index-tts
arXiv 기술 논문: https://arxiv.org/pdf/2601.03888

07IndexTTS-2.5의 활용 사례

AI 더빙 및 오디오 콘텐츠 생성: 콘텐츠 제작자는 진행자나 캐릭터의 참조 오디오만 제공하면 다국어·다감정 스타일의 오디오북, 라디오 드라마, 팟캐스트 콘텐츠를 빠르게 생성할 수 있어 반복 녹음이 필요하지 않습니다.
다국어 동영상 현지화: 영화·영상 및 숏폼 동영상 제작팀은 중국어 참조 오디오로 영어, 일본어, 스페인어 또는 아랍어 더빙을 직접 생성하면서 원 배우의 음색을 유지할 수 있어 해외 배포 비용을 크게 줄일 수 있습니다.
게임 및 가상 캐릭터 음성: 게임 개발사는 NPC나 버추얼 아이돌의 특정 음색을 복제하고, 감정 벡터를 통해 희로애락을 실시간으로 전환하여 동적 스토리 음성과 라이브 상호작용을 구현할 수 있습니다.
실시간 음성 상호작용 및 디지털 휴먼: 0.20의 초저 실시간률을 바탕으로 IndexTTS-2.5는 스마트 고객 서비스, 디지털 휴먼 라이브 방송 및 실시간 번역 환경에 배포할 수 있으며, 낮은 지연 시간의 개인화 음성 응답을 지원합니다.
교육 및 언어 학습: 교육 기관은 발음 제어 기능으로 표준 병음, CMU 음소 또는 일본어 가나 예시 오디오를 생성하고, 교사의 음색을 복제하여 다국어 동기화 강의를 제작할 수 있습니다.

© 면책 조항: 도메인 및 연결된 콘텐츠는 시간이 지나면서 변경될 수 있습니다. AIEZZ은(는) 제3자 웹사이트를 관리하지 않습니다. 외부 콘텐츠와 위험을 독립적으로 검토하세요.

사용자 리뷰0