Skip to content

Latest commit

 

History

History
169 lines (105 loc) · 5.44 KB

File metadata and controls

169 lines (105 loc) · 5.44 KB
voiceBox

voiceBox

克隆任意声音 · 朗读任何文字 · 全程在你的 Mac 上

本地声音克隆 · 长文朗读 · 零云端 · Apple Silicon 原生

English · 中文 · 日本語

Download Platform Chip


一句话

用 5 秒参考音,本地克隆任意中英声音,把整篇长稿合成成自然的语音 —— 全程不上传一个字节。


✨ 它能做什么

  • 🎙 声音克隆 · 拖一段 5–15 秒人声,自动转录,生成新的克隆音色
  • 📝 长文朗读 · 上千字脚本自动分段,流式播放
  • 🎧 多格式导出 · WAV / M4A / MP3,一键 ⌘S
  • 📚 声音库 · 多音色保存,跨次启动持续
  • 🕘 生成历史 · 自动归档每次合成,随时回听 / 重导出
  • 🛡 完全本地 · 推理在 Apple Silicon 本地完成,无网络请求

📦 下载

⬇️ 下载最新版

或打开 Releases 页面 选择历史版本。


🚀 安装

  1. 下载 voiceBox-X.Y.Z.dmg 并双击挂载
  2. voiceBox.app 拖入 Applications 文件夹
  3. 首次打开 · 在「应用程序」里右键(或 Control 点击)voiceBox.app → 选打开 → 弹窗里再点打开
  4. 之后双击即可启动

应用未做 Apple 公证,首次需绕过 Gatekeeper —— 这是 macOS 对非公证软件的统一处理,不是 voiceBox 的问题。 如果出现「已损坏」提示,终端执行:xattr -dr com.apple.quarantine /Applications/voiceBox.app


🎬 工作流

   ┌──────────────┐      ┌──────────────┐      ┌──────────────┐
   │ Reference    │      │  Your        │      │  Cloned      │
   │  Audio (5s)  │  +   │   Script     │  →   │   Speech     │
   │  + ASR text  │      │  (any len)   │      │  WAV/M4A/MP3 │
   └──────────────┘      └──────────────┘      └──────────────┘
       (one click ✨)         (paste / drop)         (⌘S export)

3 步上手:

  1. Studio 标签页 → 点声音胶囊 → 添加声音 → 拖入参考音频 → 点 ✨ 自动转录 → 保存
  2. Studio 主输入框 → 粘贴脚本(或拖入 .txt)→ 选音色
  3. ⌘↩ 生成 · 听完 · ⌘S 导出

🧠 技术

用途 引擎 来源
语音合成 TTS Qwen3 语音引擎 Alibaba Qwen
语音识别 ASR Qwen3 语音识别 Alibaba Qwen
端侧加速 Apple Silicon(GPU / 神经引擎) Apple

首次启动会下载语音模型(共 ~4 GB),建议接稳定网络;之后全部离线运行。


❓ 常见问题

voiceBox 开源吗?

二进制版本可免费个人使用,源码不公开。voiceBox 基于开源模型和框架构建,详见下方致谢。

会不会上传我的声音或文本?

不会。所有语音计算都在你 Mac 本地的 GPU / 神经引擎上跑,完全离线。唯一的网络请求只在首次启动:下载语音模型。下载完成后可以断网使用。

支持哪些语言?

中文(普通话)和英文表现最好。Qwen3 语音引擎官方还支持西语、法语、德语、日语、葡萄牙语、意大利语等十种语言。

为什么不上 Mac App Store?

App Store 沙盒会破坏我们需要的本地文件访问(参考音频、导出)。直接分发体验更干净。

可以商用吗?

应用本身免费,但底层 Qwen3 模型的商用授权请遵循各自模型 license。voiceBox 不为模型输出承担合规责任。


📋 系统要求

  • macOS 15+(Sequoia 或更新)
  • Apple Silicon(M1 / M2 / M3 / M4)
  • 至少 5 GB 可用磁盘空间
  • 网络(仅首次下载模型)

🗺 路线图

  • 应用公证 + 自动更新(Sparkle)
  • 多音色批量生成
  • 字幕(SRT)同步导出
  • 自定义停顿 / 强调标记
  • iOS 版本

🙏 致谢

没有这些项目,就没有 voiceBox:

  • MLX by Apple — the framework
  • mlx-audio-swift by Prince Canuma — the Swift TTS/STT layer
  • mlx-audio by Prince Canuma — the Python research playground
  • Qwen by Alibaba — TTS & ASR models
  • Hugging Face — model distribution

📮 反馈

发现 bug / 想加功能?开个 Issue


Made with ☕ on Apple Silicon.