本地运行的通义千问 TTS,支持 10 语言与指令控制情感语调,离线可用,无需云端 API。
说明:
## 核心用法
Qwen TTS 是一款基于 Hugging Face Qwen3-TTS-12Hz-1.7B-CustomVoice 的本地文本转语音工具,用户通过命令行脚本即可生成高质量语音。核心指令为 `scripts/tts.py`,支持 `-l` 指定语言、`-s` 切换 9 种精品说话人、`-i` 以自然语言指令控制情绪与风格(如 “Parla con entusiasmo”)。首次运行需执行 `setup.sh` 创建约 500MB 的虚拟环境,模型文件约 1.7GB 在首次合成时自动下载,此后完全离线运行。
## 显著优点
– **完全本地化**:无需订阅 ElevenLabs 等云服务,无 API 费用与网络延迟,适合隐私敏感场景。
– **多语言支持**:覆盖中文、英语、日语、韩语、德语、法语、俄语、葡萄牙语、西班牙语、意大利语 10 种语言,且跨语言合成效果可用。
– **指令可控**:通过 `-i` 参数以自然语言描述情感、语速、风格,实现零样本风格迁移。
– **9 种精品音色**:包含中英日韩多地域特色说话人,如北京腔 Dylan、成都腔 Eric、美式 Ryan 等,音色区分度鲜明。
– **OpenClaw 兼容**:脚本标准输出音频路径,便于自动化工作流集成。
## 潜在局限
– **硬件门槛**:GPU 合成仅需 1-3 秒,但 CPU 需 10-30 秒,低配置设备体验受限;1.7GB 模型对内存/显存有一定要求。
– **说话人数量**:仅 9 个预设音色,无法像云端服务那样上传自定义声音克隆。
– **音质上限**:16kHz WAV 输出,虽清晰但未达到 44.1kHz 或更高采样率标准,后期如需广播级音质需上采样处理。
– **中文偏见**:模型训练数据以中文为主,非中文说话人合成非母语时可能出现轻微口音或韵律偏差。
## 适合人群
– 注重数据隐私、需要离线 TTS 的个人开发者与内容创作者;
– 多语言应用开发者,需低成本集成意/德/法/俄等语种语音;
– 希望用自然语言指令快速调整播报情绪、风格的播客与视频制作者;
– 需要与 OpenClaw 等自动化框架对接的技术用户。
## 常规风险
– **初始下载依赖 Hugging Face**:首次模型拉取受网络环境影响,中国大陆用户需配置镜像(HF_ENDPOINT);下载失败将导致功能不可用。
– **Python 版本锁定**:仅支持 Python 3.10-3.12,系统 Python 版本不匹配需手动安装或调整环境。
– **许可合规**:模型授权条款以 Hugging Face 模型卡为准,商用需自行确认当前 license(如 Qwen License 2.0 或其变体)。
– **输出文件管理**:脚本默认输出至当前目录,未自动清理,长期运行需关注磁盘空间。









