模型百科
⚖️
去对比 →
模型对比
热门模型横向对比 · 擅长/不擅长/价格一目了然
剪映数字人 剪映语音合成
语音
剪映内置的数字人播报与语音合成,做口播视频零门槛
擅长
中文音色多、数字人形象、剪映生态内直接用、免费
不擅长
音色辨识度一般、情感表达有限
价格
剪映 App 免费使用;高级音色需会员,仅供参考
适合人群
新手
ElevenLabs v3 多语言
全球顶级 AI 语音合成,音色真实自然、多语言支持
擅长
音色最真实、情感表现力强、多语言
不擅长
中文音色较少、国内访问受限、按字符计费
价格
免费版每月少量额度;Starter 约 5 美元/月起,仅供参考
适合人群
创作者
豆包语音 豆包 TTS
语音
火山引擎(字节)出品,豆包/即梦内置配音,中文音色多、免费额度大
擅长
中文音色丰富、与豆包生态联动、免费额度大、情绪自然
不擅长
音色辨识度一般、克隆需 API 企业版
价格
豆包 App 免费;火山引擎 API 按字符计费,仅供参考
适合人群
新手
阿里云语音合成 CosyVoice / 通义
阿里通义实验室出品,CosyVoice 3.0 开源,中文 TTS 工业部署事实标准
擅长
18+ 中文方言、零样本克隆、150ms 流式低延迟、开源可部署
不擅长
部署较复杂(约5GB模型)、工程链路偏重
价格
通义平台有免费额度;CosyVoice 开源版免费自部署,仅供参考
适合人群
开发者
通义 Qwen3-TTS Qwen3-TTS 1.7B
语音
阿里 Qwen 团队开源语音大模型,中文综合最强、3 秒克隆、97ms 低延迟
擅长
中文首选、3秒声音克隆、97ms 实时延迟、音色设计
不擅长
新模型工程实践还在沉淀、方言支持待完善
价格
开源免费自部署(Apache-2.0),仅供参考
适合人群
开发者
GPT-SoVITS v4
开源中文 TTS 榜首(59k star),1 分钟音频即可微调出专属音色
擅长
少样本微调(1分钟)、中文领先、48kHz 高保真、零样本克隆
不擅长
本地需 GPU、实时交互弱
价格
开源免费自部署(MIT),需 RTX 显卡,仅供参考
适合人群
开发者
ChatTTS 2B
开源对话式 TTS(39k star),口语化最自然,带笑声/停顿/语气
擅长
对话自然度最高、中文口语化、流式输出、零样本克隆
不擅长
多音字偶有误读、长文本需分段
价格
开源免费自部署(Apache-2.0),仅供参考
适合人群
创作者
Fish Audio Fish Speech S2
语音
开源多语种 TTS,覆盖 80+ 语言,情绪控制细腻,云端 API 可选
擅长
80+ 语言、情绪标签控制、高保真 44.1kHz、流式
不擅长
商用需单独授权、全功能模型需云端
价格
开源版免费;官方云 API 按量计费,仅供参考
适合人群
开发者
微软语音 VibeVoice / Edge TTS
微软开源语音 AI(VibeVoice 7B)+ Edge 浏览器免费朗读,长音频强
擅长
最长90分钟连续输出、多说话人播客、37种语言、Edge 免费
不擅长
表现力中等、中文情感一般
价格
Edge TTS 免费;VibeVoice 开源自部署(MIT),仅供参考
适合人群
新手
Kokoro 82M
超轻量开源 TTS(82M 参数),CPU 就能跑,边缘设备首选
擅长
轻量(82M)、CPU 可跑、部署简单
不擅长
复杂情绪有限、自然度一般
价格
开源免费自部署(Apache-2.0),仅供参考
适合人群
开发者
MiniMax 语音 海螺 TTS
MiniMax 出品,海螺 App 内置,中文配音自然、情感丰富
擅长
中文自然、情感丰富、海螺生态联动
不擅长
音色选择少、API 需企业认证
价格
海螺 App 免费;API 按量计费,仅供参考
适合人群
创作者
VoxCPM2 2B
面壁智能+清华开源语音基础模型,48kHz 高保真,音色可凭空设计
擅长
48kHz Hi-Fi、音色设计、30国语言+9大方言、3-10秒克隆
不擅长
新模型生态待完善、需12GB显存
价格
开源免费自部署(Apache-2.0),仅供参考
适合人群
开发者
IndexTTS2 B站开源
B 站开源的工业级零样本 TTS,中文音色还原度高
擅长
零样本克隆、中文音色还原、工业级稳定
不擅长
多语种一般、部署要求中
价格
开源免费自部署,仅供参考
适合人群
开发者