IndexTTS logo

IndexTTS

★★★★ 4.4/5
访问官网
分类
音视频
定价
免费
访问
直连可用

快速结论

IndexTTS 是 B 站语音团队发布的可控零样本文本转语音系统,唯一官方代码渠道是 index-tts/index-tts。截至 2026-07-20,仓库未归档且仍有更新,主线已转向 IndexTTS2;官方同时提醒仓库历史已重置,旧克隆应删除后重新拉取。IndexTTS2 用一段音色参考生成新文本语音,并把说话人特征与情感条件解耦,可使用另一段情感音频、八维情感向量或文本描述控制表现。中文拼音标注可用于部分多音字纠音。

选择时要注意两个容易误读的事实。第一,论文和 README 介绍了精确时长控制方法,但官方更新仍明确写着该功能尚未在当前发布版启用,不能据此承诺成片对口型。第二,仓库不是 Apache-2.0:根目录采用 bilibili Model Use License Agreement,覆盖发布的 IndexTTS2 模型、权重和最终代码,并含规模门槛、下游分发与用途限制。它适合有 GPU、本地运维和权利审查能力的中文配音团队,不适合未经同意复制可识别个人声音。

核心功能

  • 零样本音色复现:使用音色参考音频驱动新文本合成,无需为每个声音重新训练;相似度仍受参考录音、语种和文本影响。
  • 音色与情感解耦:可分别提供 speaker prompt 和 emotion prompt,让同一授权音色采用不同表现方式,而不必用情绪录音替换身份条件。
  • 多种情感控制:支持情感参考音频、八维情感向量、根据正文推断情绪,以及独立的情感文本描述;emo_alpha 用于调节影响强度。
  • 中文字/拼音混合:可在文本中加入合法拼音标注,处理部分多音字和长尾读音;官方说明并非任意声韵组合都有效。
  • 自然时长与研究中的精确时长:当前可让自回归模型自然生成;论文提出指定 token 数的精确时长方案,但发布版尚未开放该能力。
  • 本地 WebUI 与 Python 推理:官方支持以 uv 管理环境,使用 Hugging Face 或 ModelScope 下载 checkpoint,并通过 WebUI 或 IndexTTS2 Python 接口运行。
  • 推理优化开关:提供 FP16、flash-attention、torch.compile 和 DeepSpeed 等可选路径;实际收益依 GPU、驱动和系统而变,DeepSpeed 也可能更慢。

适合人群

  • 已获得演员或员工声音授权,希望在内部生成中文/英文配音草稿、角色对白或有声内容的团队。
  • 需要把音色与情绪分别控制,并愿意对每段输出做发音、表现和身份披露审核的制作人员。
  • 能维护 uv、Git LFS、CUDA 12.8+、大体积 checkpoint 和本地 WebUI/API 的研发团队。
  • 研究自回归 TTS、跨语种生成、情感控制和时长建模的实验室。

若只需要更成熟的少样本数据训练工作台,可比较 GPT-SoVITS;若希望免运维使用托管 API,可看 ElevenLabs。任何选择都不能取代声音授权。

使用场景

IndexTTS2 适合先以授权演员的一段干净参考录音固定音色,再通过独立情感条件生成不同语气的广告样稿、游戏角色对白或教学旁白。拼音控制可用于人名、地名和多音字,但要让母语审听员逐句确认。由于当前精确时长功能未发布,视频配音应预留后期剪辑、语速调整和重录,不要将论文能力写进交付 SLA。

团队应建立声音资产登记:记录权利人、授权文本、允许语言和渠道、有效期、撤回方式、reference hash、checkpoint、操作者及输出去向。对外音频要清晰披露 AI 合成身份,不得用于未经授权的身份利用、冒充、欺诈或骚扰,也不能让生成声音充当认证凭证。电话、客服或交互产品还需按参与者所在地核对录音同意要求;涉及付款、身份、医疗、法律和投诉时,应提供明确的人工接管和独立验证。

价格与版本

IndexTTS1、1.5 与 2 的代码和 checkpoint 可从官方仓库及模型页下载,运行本身没有订阅费,实际支出包括 NVIDIA GPU、存储、录音授权、人工审听和安全维护。官方安装当前要求使用 uv,并建议 CUDA 12.8 或更新版本;Windows 上 DeepSpeed 和 flash-attention 兼容性需额外处理。

许可证是决策重点。当前根许可证是 B 站自定义模型使用协议,不是 Apache-2.0。协议对发布的 IndexTTS2 权重与最终代码授予有限许可,但当企业及关联方前一月产品月活超过 1 亿,或前一年度营收超过人民币 10 亿元时,需要另行获得书面许可;分发衍生作品还要保留通知、附协议并向下游施加条件,且包含模型改进和高风险用途限制。第三方依赖、输入录音、情感参考和输出中的人格权/表演者权仍需另行核验。商业合作应按官方 README 联系 [email protected]

国内访问与使用体验

官方同时提供 Hugging Face 与 ModelScope checkpoint 和 Demo,国内部署可优先从 ModelScope 获取大文件。安装需要 Git LFS 和 uv sync,WebUI 默认运行在本机 7860 端口。FP16 可降低显存并提高速度,但会带来轻微质量变化;--accel--torch_compile 与 DeepSpeed 都需要匹配的依赖和硬件,不能默认全部开启。

生产中应固定提交、checkpoint hash、依赖锁文件与启动参数,避免仓库历史重置或模型更新造成不可复现。WebUI 不应直接暴露公网;需添加认证、文件校验、租户隔离、录音加密、密钥管理、输出追踪和最短保留期。社区包装站并非官方渠道,官方明确不保证其安全、准确性或时效。

优点

  • 音色与情感条件分开,情感音频、向量和文字描述提供了多种可控入口。
  • 中文字/拼音混合对多音字、人名和长尾读音有实际价值。
  • WebUI、Python 接口、ModelScope 与 Hugging Face 下载路径完整,便于本地试验。
  • FP16、编译内核等优化选项允许按硬件平衡显存、速度和质量。
  • 官方仓库持续更新,IndexTTS1 旧路径与 IndexTTS2 主线都有明确说明。

不足

  • README 描述的精确时长控制在当前发布版尚未启用,视频对齐仍需后期工作。
  • 官方安装强调 NVIDIA CUDA 12.8+ 和 uv;模型较大,Windows 加速依赖可能较难配置。
  • 主要示例和优势集中在中文与英文,多语种或跨语种效果需按目标语言实测。
  • 自定义模型许可含规模门槛、下游义务和用途限制,不能按 Apache/MIT 项目处理。
  • 零样本音色复现有冒充风险,项目本身不替团队完成授权核验、披露、水印和滥用响应。

替代品对比

工具更适合什么主要差异
GPT-SoVITS少量数据微调与多语种 TTS 工作流数据处理工具更完整,代码 MIT,但各权重仍需核验
CosyVoice多语种与流式语音生成研究模型架构和部署生态不同,应独立比较语言与许可
Fish Audio开源模型结合托管平台更偏产品化模型平台,数据和计费边界不同
ElevenLabs快速接入商业语音 API运维少但持续付费,声音数据由第三方平台处理
ApplioRVC 歌声与语音转换转换已有音频,不是相同的零样本文本转语音路线

常见问题 FAQ

IndexTTS2 的精确时长控制现在可用吗?

官方 README 截至本次核验仍注明该功能尚未在当前发布版启用。论文方法和演示不能替代可下载代码的验收,配音项目应按自然时长能力规划。

IndexTTS 是 Apache-2.0 吗?

不是。当前官方仓库根目录使用 B 站自定义模型使用协议,GitHub 也显示为非标准许可证。部署前应由法务阅读原文,而不是沿用旧介绍。

自定义许可证允许商业使用吗?

协议授予有条件的使用权,但含企业规模门槛、下游分发、模型改进和高风险场景等限制。超过门槛或需要合作时,应联系官方取得单独许可。

能否用公开视频作为音色参考?

不应仅凭“公开可听”使用。音色属于可识别个人特征,需获得覆盖训练、生成、语言、渠道和期限的明确授权,并提供撤回与投诉机制。

一定要用 NVIDIA GPU 吗?

当前官方安装和加速说明围绕 CUDA 12.8+,这是最受支持的路径。具体显存取决于精度和加速参数,应在目标设备上测试,不能根据模型宣传推断。

如何降低滥用与泄露风险?

隔离 WebUI,限制上传,验证授权人,记录 reference 和输出 provenance,对外披露合成身份,禁止高风险冒充,并对敏感操作设置独立认证和人工复核。

总结

IndexTTS2 的核心吸引力是把授权音色、情感条件和中文发音控制拆开,而不是已经交付了所有论文功能。它适合有本地 GPU、审听能力和许可证治理的团队做可控中文配音。采用前要以当前代码验证语言、自然度、延迟和显存,明确精确时长仍不可用,并按自定义协议评估规模和分发义务。只有声音授权、AI 披露、安全隔离、输出追踪和人工升级机制一并落地,零样本能力才有生产价值。

最后更新:2026年7月20日

同类工具推荐