用 5 秒参考音,本地克隆任意中英声音,把整篇长稿合成成自然的语音 —— 全程不上传一个字节。
- 🎙 声音克隆 · 拖一段 5–15 秒人声,自动转录,生成新的克隆音色
- 📝 长文朗读 · 上千字脚本自动分段,流式播放
- 🎧 多格式导出 · WAV / M4A / MP3,一键 ⌘S
- 📚 声音库 · 多音色保存,跨次启动持续
- 🕘 生成历史 · 自动归档每次合成,随时回听 / 重导出
- 🛡 完全本地 · 推理在 Apple Silicon 本地完成,无网络请求
或打开 Releases 页面 选择历史版本。
- 下载
voiceBox-X.Y.Z.dmg并双击挂载 - 把
voiceBox.app拖入Applications文件夹 - 首次打开 · 在「应用程序」里右键(或 Control 点击)
voiceBox.app→ 选打开 → 弹窗里再点打开 - 之后双击即可启动
应用未做 Apple 公证,首次需绕过 Gatekeeper —— 这是 macOS 对非公证软件的统一处理,不是 voiceBox 的问题。 如果出现「已损坏」提示,终端执行:
xattr -dr com.apple.quarantine /Applications/voiceBox.app
┌──────────────┐ ┌──────────────┐ ┌──────────────┐
│ Reference │ │ Your │ │ Cloned │
│ Audio (5s) │ + │ Script │ → │ Speech │
│ + ASR text │ │ (any len) │ │ WAV/M4A/MP3 │
└──────────────┘ └──────────────┘ └──────────────┘
(one click ✨) (paste / drop) (⌘S export)
3 步上手:
- Studio 标签页 → 点声音胶囊 → 添加声音 → 拖入参考音频 → 点 ✨ 自动转录 → 保存
- Studio 主输入框 → 粘贴脚本(或拖入
.txt)→ 选音色 - ⌘↩ 生成 · 听完 · ⌘S 导出
| 用途 | 引擎 | 来源 |
|---|---|---|
| 语音合成 TTS | Qwen3 语音引擎 | Alibaba Qwen |
| 语音识别 ASR | Qwen3 语音识别 | Alibaba Qwen |
| 端侧加速 | Apple Silicon(GPU / 神经引擎) | Apple |
首次启动会下载语音模型(共 ~4 GB),建议接稳定网络;之后全部离线运行。
voiceBox 开源吗?
二进制版本可免费个人使用,源码不公开。voiceBox 基于开源模型和框架构建,详见下方致谢。
会不会上传我的声音或文本?
不会。所有语音计算都在你 Mac 本地的 GPU / 神经引擎上跑,完全离线。唯一的网络请求只在首次启动:下载语音模型。下载完成后可以断网使用。
支持哪些语言?
中文(普通话)和英文表现最好。Qwen3 语音引擎官方还支持西语、法语、德语、日语、葡萄牙语、意大利语等十种语言。
为什么不上 Mac App Store?
App Store 沙盒会破坏我们需要的本地文件访问(参考音频、导出)。直接分发体验更干净。
可以商用吗?
应用本身免费,但底层 Qwen3 模型的商用授权请遵循各自模型 license。voiceBox 不为模型输出承担合规责任。
- macOS 15+(Sequoia 或更新)
- Apple Silicon(M1 / M2 / M3 / M4)
- 至少 5 GB 可用磁盘空间
- 网络(仅首次下载模型)
- 应用公证 + 自动更新(Sparkle)
- 多音色批量生成
- 字幕(SRT)同步导出
- 自定义停顿 / 强调标记
- iOS 版本
没有这些项目,就没有 voiceBox:
- MLX by Apple — the framework
- mlx-audio-swift by Prince Canuma — the Swift TTS/STT layer
- mlx-audio by Prince Canuma — the Python research playground
- Qwen by Alibaba — TTS & ASR models
- Hugging Face — model distribution
发现 bug / 想加功能?开个 Issue。
Made with ☕ on Apple Silicon.