← 返回首页

Apple Silicon 上的文本转语音:MLX + Qwen-TTS 实践

Qwen3-TTS 0.6B 是阿里推出的轻量级文本转语音模型,专为边缘设备优化。结合 Apple 的 MLX 框架,可以在 Mac 上高效运行,充分利用 M 系列芯片的统一内存架构和神经网络引擎。

性能基准

模型: Qwen3-TTS 0.6B (MLX)
硬件: MacBook Pro M3 Max 36GB
推理速度: 实时因子 0.3x(比实时快 3 倍)
内存占用: ~800MB(模型 + 运行时)

实际应用

通过 Hermes Agent 的 TTS 集成,可以直接将文本回复转换为语音消息发送到 Telegram。支持自动 max_tokens 优化和章节分割(按 ===CHAPTER:=== 标记拆分长文本),确保每条语音消息在 Telegram 的时长限制内。

相比云端 TTS 服务,本地推理的优势在于零延迟、零成本、隐私安全——所有音频合成都在本地完成,无需上传文本到第三方服务。

MLX TTS Apple Silicon Qwen