Apple Silicon 本地语音转文字,免 API 免云端,开源模型精准识别
说明:
## 核心用法
`mlx-stt` 是一款基于 Apple MLX 框架的本地语音识别工具,专为 Apple Silicon Mac 设计。用户通过 `/mlx-stt
### 显著优点
1. **完全本地化**:依托 Apple MLX 框架,所有推理在本地完成,音频数据不上传云端,隐私性极强
2. **零成本使用**:无需 API Key,无订阅费用,开源模型可免费商用
3. **开箱即用**:通过 `brew` 自动安装 ffmpeg、uv、mlx_audio 等依赖,降低技术门槛
4. **模型轻量**:默认采用 GLM-ASR-Nano-2512,针对效率优化,适合个人设备实时或批量处理
### 潜在局限
– **硬件限制**:仅限 Apple Silicon Mac(M1/M2/M3/M4),Intel Mac 无法运行
– **首次启动慢**:需下载模型文件,网络条件差时体验受影响
– **功能单一**:专注语音转文字,无说话人分离、时间戳对齐等高级功能
– **中文生态弱**:GLM-ASR 虽支持中文,但与 Whisper 相比社区资源和文档较少
### 适合人群
– 注重隐私的自媒体创作者、播客制作者
– 需要批量转写会议录音的职场人士
– Apple Silicon 用户且不愿支付 API 费用的开发者
### 常规风险
– 音频文件路径需合法,避免误处理敏感系统文件
– 长音频转写占用内存,建议分段处理 1 小时以上录音
– 模型输出需人工校对,关键场景不可直接作为法律或医疗凭证
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END








