装进本机的语音 AI 工作台:配音、转写、播客、人声分离、音频剪辑、翻译——一个应用全办妥,云端引擎与本地推理兼备。
语音合成:六套引擎(火山 / 千问 / 小米 / 智谱 / OpenRouter / 本地推理)一台切换,同步、流式、长文本三通道。
人声分离:格式工厂 / 转换猫(免费)、MVSep(120+ 算法)、火山 MediaKit 四引擎可选。
![]() |
![]() |
| 播客工坊:一句话主题,双音色逐轮生成 | 本地环境:引擎与模型一键下载,离线可用 |
![]() |
![]() |
| 工作台:工具入口与运行概况 | 音频剪辑:切割合并变调,本机完成 |
| 功能 | 说明 |
|---|---|
| 语音合成 | 文本转语音:同步秒级 / 流式低延迟(20 语种 8 方言)/ 长文本 10 万字,可出 SRT 字幕,支持情感与风格指令 |
| 语音识别 | 音频转文字:本地文件或 URL,分句时间戳、SRT 字幕;极速版秒级返回,闲时版更省钱 |
| 播客工坊 | 一句话主题、长文本、网页或对话稿,双音色逐轮生成双人播客 |
| 人声分离 | 人声 / 伴奏 / 鼓 / 贝斯等分轨输出:免费通道开箱即用,MVSep 120+ 算法,MediaKit 人声背景双轨 |
| 音频剪辑 | 切割、合并、变调变速、乐调与 BPM 查询、均衡器、音量响度、淡入淡出、倒放,全部本机完成 |
| 音频后期 | 混音台(垫音 / 低切 / 音量包络)、自动切高潮、口播闪避 |
| 格式工厂 | 视频 / 音频 / 图片在线转换与压缩,免费 |
| 机器翻译 | 32 语种互译、自动检测源语言、术语定制 |
| 语音妙记 | 音视频转结构化纪要:全文总结、待办提取、章节速览 |
| 字幕工坊 | 分句时间戳转 SRT / ASS 样式字幕,卡拉 OK 逐字渲染;字幕翻译(AI / 火山 / 免费源)与双语导出、时间轴校准、中文去标点 |
| 计费测算 | 各引擎刊例价同量对比,用前先算账 |
| AI 助手 | 全站悬浮对话窗,直接复用已配置的 API Key |
从 Releases 下载最新的 desktop-v* 版本:
| 平台 | 文件 |
|---|---|
| macOS(Apple Silicon) | VoxBox_*_aarch64.dmg |
| macOS(Intel) | VoxBox_*_x64.dmg |
| Windows | VoxBox_*_x64-setup.exe |
安装打开即用,无需注册登录。剪辑、音色库、克隆合成等依赖的 FFmpeg 已内置,开箱即用。
Windows 首次运行:SmartScreen 弹窗点「更多信息」→「仍要运行」。
打开后在 设置 → 云端服务 填入各家 API Key 即可使用对应云端能力;不配任何凭证,也能用格式工厂免费通道和本地推理(设置 → 本地环境 下载引擎与模型后离线使用)。应用启动时自动检查更新,确认后一键升级。
从 Releases 下载 v* 版本对应平台的 zip,解压即得单个可执行文件:
./voxbox serve --port 8081
# 浏览器打开 http://127.0.0.1:8081macOS 下若提示「Apple could not verify」,执行
xattr -d com.apple.quarantine ./voxbox移除隔离属性即可。
凭证在 Web 设置页填写,与桌面版完全一致。也可以从源码构建:make all 产出 bin/voxbox。
模型、任务与产物、任务数据库默认保存在 ~/.voxbox/data(跟随用户主目录),可以在 Web 设置页「本地环境 → 数据保存位置」修改并重启生效;等价地直接编辑 ~/.voxbox/config.yaml 的 data_dir 键。以 VOXBOX_HOME 环境变量指定的隔离根目录优先级最高:设置后数据目录固定为 $VOXBOX_HOME/.voxbox/data,显式配置不再参与(供服务器部署与冒烟测试把配置、数据整体挪到独立目录)。
修改保存位置不会自动迁移旧数据。需要搬移时先停止服务,再把整个目录挪过去(macOS/Linux 用 mv;Windows 建议先 robocopy /L 演练再 move),模型也可以删除后在设置页重新下载。
模型在 设置 → 本地环境 一键下载,全部本机运行、数据不出设备;运行引擎(sherpa-onnx / audio.cpp)会按所装模型自动下载。
语音识别(ASR)
| 模型 | 大小 | 适用场景 |
|---|---|---|
| SenseVoice(int8) | 163MB | 中英日韩粤,自动标点;文件转写、录音笔记、字幕工坊的识别源,CPU 秒级,低配机器首选 |
| Confucius4-R2T2(q8) | 2.5GB | 30 语自动检测,支持热词与上下文;实时语音识别(边说边出字)首选;无时间戳,不适合出字幕 |
语音合成(TTS)
| 模型 | 大小 | 适用场景 |
|---|---|---|
| Kokoro 82M | 349MB | 53 个内置音色(含 8 个中文)中英混读,CPU 秒级;不支持克隆——朗读、播客最轻量的起点 |
| Chatterbox 0.5B(q8) | 2.1GB | 零样本音色克隆,英文为主 19 语(无中文),需真人参考音频 |
| Qwen3-TTS 0.6B 克隆(q8) | 2.0GB | 参考音频复刻音色的低配变体,磁盘与内存占用更小 |
| Qwen3-TTS 1.7B 克隆(q8) | 2.7GB | 3 秒参考音频复刻音色,克隆配音的主力 |
| Qwen3-TTS 预置音色(q8) | 2.8GB | 9 个预置音色 + 自然语言风格指令,不想录参考音频就用它 |
| IndexTTS 2.5(q8) | 3.5GB | 音色克隆 + 情感文本控制,中英日西阿多语——中文情感配音 |
| VoxCPM2 2B(q8) | 3.0GB | 30 语含 9 种中文方言;克隆、无参考直读与音色设计(文字描述造音色),48kHz 输出 |
同一个可执行文件也是 CLI,适合脚本与自动化(加 --json 输出机器可读结果):
voxbox tts "你好,voxbox" --out hello.mp3 # 文本转语音
voxbox asr meeting.mp3 --out transcript.txt # 音频转文字
voxbox podcast "聊聊本地大模型" --speakers <音色A>,<音色B> --out podcast.mp3
voxbox separate song.mp3 --engine gsgc --stems both # 人声伴奏分离(免费通道)
voxbox translate "你好,世界" --to en --out en.txt # 机器翻译完整命令与参数见 CLI 完整参考,或 voxbox <命令> --help。
voxbox skill install # 把能力说明装进本机 agent(Claude Code / WorkBuddy / CodeBuddy)
voxbox mcp # stdio MCP server,Claude Code 等 MCP 客户端可直连MCP 接入配置见 docs/mcp.md。
| 平台 | 需要什么 | 覆盖能力 |
|---|---|---|
| 火山引擎 | APP ID + Access Token,或新版 API Key | 合成 / 识别 / 播客 / 翻译 / 妙记 |
| 火山 AI MediaKit | MediaKit API Key(独立) | 人声背景分离 |
| 千问 / 小米 / 智谱 | 各一个 API Key | 合成与识别备选引擎 |
| OpenRouter | 一个 API Key(openrouter.ai 创建) | Gemini TTS 合成备选引擎 |
| MVSep | API Token(mvsep.com 注册获取) | 120+ 分离算法 |
| 格式工厂 / 转换猫 | 无需凭证 | 免费分离与格式转换 |
| 本地推理 | 无需凭证 | 离线合成与识别 |
凭证、任务与产物都保存在本机数据目录,不上传、不同步;只有你主动使用的云端能力才会把内容发给对应服务商。
make all # 构建前端 + 编译单二进制到 bin/voxbox
make test # Go 测试全量
make dist # 交叉编译五个平台打包到 dist/单二进制:前端产物 go:embed 内嵌,SQLite 存状态,零外部依赖,可交叉编译。技术栈:Go(gin / gorm / cobra)· React 19 + TypeScript + Vite + Tailwind CSS v4 · Tauri 2(桌面壳)。
- UI 设计规范:色彩 / 字体 / 间距 / 组件规格
- MCP Server:
voxbox mcp接入配置与工具清单 - JSON 输出契约:
--json/ MCP 输出的字段与稳定性承诺 - 桌面版发布走 GitHub Actions(
.github/workflows/desktop-release.yml),本地构建make desktop
MIT.





