基于 Edge-TTS 的本地语音合成工具,自动清洗 Markdown、智能分段,零 Token 消耗生成 Telegram 原生语音气泡。
说明:
## 核心用法
`telegram-offline-voice` 是一款专为 Telegram 场景设计的离线语音生成工具。用户通过 `voice_gen.py` 脚本输入待播报文本,工具自动完成「文本清洗 → Edge-TTS 合成 → FFmpeg 转码 OGG → 返回文件路径」的完整流水线。支持通过 `–voice` 切换中文声线(默认晓晓)、`–rate` 调节语速、`–outdir` 指定临时目录。
## 显著优点
1. **零成本运行**:基于 Microsoft Edge-TTS 开源引擎,无需 OpenAI/Azure 等付费 Token,长期使用无经济负担。
2. **隐私完全自主**:100% 本地音频处理,文本与语音数据不经过第三方 TTS 云服务商,适合敏感内容播报。
3. **工程化体验**:自动清洗 Markdown 标记、URL 链接等「代码噪音」,超长文本按标点智能切分为多段语音气泡,听感接近真人对话流。
4. **高并发安全**:UUID 隔离临时文件命名,支持多代理/子代理并行调用无冲突。
5. **极速部署**:配合 `uv` 运行器可实现秒级冷启动,无需复杂虚拟环境配置。
## 潜在缺点与局限性
– **系统绑定**:依赖 FFmpeg 与 Python 环境,仅支持 Linux(作者未提供 Windows/macOS 适配)。
– **声线有限**:仅支持 Edge-TTS 内置的中文神经网络声线,无法像云端 TTS 那样微调情感风格或克隆自定义音色。
– **无实时流式输出**:需等待完整文件生成后才能获取路径,不适合极低延迟场景。
– **维护状态**:由个人开发者维护,无商业 SLA 保障,长期更新存在不确定性。
## 适合人群
– 需要为 Telegram Bot/Agent 添加语音交互能力的开发者
– 对数据隐私敏感、拒绝云端 TTS 的本地优先用户
– 希望以零 API 成本实现中文语音合成的个人项目或中小团队
## 常规风险
– **临时文件堆积**:若进程异常退出,/tmp 目录可能残留 UUID 命名的音频碎片,建议配合定时清理策略。
– **FFmpeg 版本兼容**:旧版本 FFmpeg 可能对 OGG Opus 编码参数支持差异导致 Telegram 无法识别,建议使用 4.4+ 版本。
– **Edge-TTS 服务可用性**:虽为本地引擎,但首次运行或更新时仍需从 Microsoft 服务器下载模型权重,网络受限环境可能受阻。







