Skip to content
yann0917Public

About

语音处理工具箱,支持豆包语音、千问、小米、智谱、minimax、OpenRouter等平台接入。也可接入 indexTTS-2.5, QWen3-TTS等本地语音识别语音合成大模型。

Topics

Resources

Code of conduct

Contributing

Security policy

Stars

4 stars

Watchers

0 watching

Forks

Repository files navigation

VoxBox

VoxBox

装进本机的语音 AI 工作台:配音、转写、播客、人声分离、音频剪辑、翻译——一个应用全办妥,云端引擎与本地推理兼备。

Release License Ask DeepWiki


界面一览

语音合成:六套引擎(火山 / 千问 / 小米 / 智谱 / OpenRouter / 本地推理)一台切换,同步、流式、长文本三通道。

语音合成

人声分离:格式工厂 / 转换猫(免费)、MVSep(120+ 算法)、火山 MediaKit 四引擎可选。

人声分离

播客工坊 本地环境
播客工坊:一句话主题,双音色逐轮生成 本地环境:引擎与模型一键下载,离线可用
工作台 音频剪辑
工作台:工具入口与运行概况 音频剪辑:切割合并变调,本机完成

能做什么

功能说明
语音合成文本转语音:同步秒级 / 流式低延迟(20 语种 8 方言)/ 长文本 10 万字,可出 SRT 字幕,支持情感与风格指令
语音识别音频转文字:本地文件或 URL,分句时间戳、SRT 字幕;极速版秒级返回,闲时版更省钱
播客工坊一句话主题、长文本、网页或对话稿,双音色逐轮生成双人播客
人声分离人声 / 伴奏 / 鼓 / 贝斯等分轨输出:免费通道开箱即用,MVSep 120+ 算法,MediaKit 人声背景双轨
音频剪辑切割、合并、变调变速、乐调与 BPM 查询、均衡器、音量响度、淡入淡出、倒放,全部本机完成
音频后期混音台(垫音 / 低切 / 音量包络)、自动切高潮、口播闪避
格式工厂视频 / 音频 / 图片在线转换与压缩,免费
机器翻译32 语种互译、自动检测源语言、术语定制
语音妙记音视频转结构化纪要:全文总结、待办提取、章节速览
字幕工坊分句时间戳转 SRT / ASS 样式字幕,卡拉 OK 逐字渲染;字幕翻译(AI / 火山 / 免费源)与双语导出、时间轴校准、中文去标点
计费测算各引擎刊例价同量对比,用前先算账
AI 助手全站悬浮对话窗,直接复用已配置的 API Key

快速开始

桌面应用(推荐)

从 Releases 下载最新的 desktop-v* 版本:

平台 文件
macOS(Apple Silicon) VoxBox_*_aarch64.dmg
macOS(Intel) VoxBox_*_x64.dmg
Windows VoxBox_*_x64-setup.exe

安装打开即用,无需注册登录。剪辑、音色库、克隆合成等依赖的 FFmpeg 已内置,开箱即用。

Windows 首次运行:SmartScreen 弹窗点「更多信息」→「仍要运行」。

打开后在 设置 → 云端服务 填入各家 API Key 即可使用对应云端能力;不配任何凭证,也能用格式工厂免费通道和本地推理(设置 → 本地环境 下载引擎与模型后离线使用)。应用启动时自动检查更新,确认后一键升级。

Web 控制台(自托管)

从 Releases 下载 v* 版本对应平台的 zip,解压即得单个可执行文件:

./voxbox serve --port 8081
# 浏览器打开 http://127.0.0.1:8081

macOS 下若提示「Apple could not verify」,执行 xattr -d com.apple.quarantine ./voxbox 移除隔离属性即可。

凭证在 Web 设置页填写,与桌面版完全一致。也可以从源码构建:make all 产出 bin/voxbox。

数据保存位置

模型、任务与产物、任务数据库默认保存在 ~/.voxbox/data(跟随用户主目录),可以在 Web 设置页「本地环境 → 数据保存位置」修改并重启生效;等价地直接编辑 ~/.voxbox/config.yaml 的 data_dir 键。以 VOXBOX_HOME 环境变量指定的隔离根目录优先级最高:设置后数据目录固定为 $VOXBOX_HOME/.voxbox/data,显式配置不再参与(供服务器部署与冒烟测试把配置、数据整体挪到独立目录)。

修改保存位置不会自动迁移旧数据。需要搬移时先停止服务,再把整个目录挪过去(macOS/Linux 用 mv;Windows 建议先 robocopy /L 演练再 move),模型也可以删除后在设置页重新下载。

本地推理模型

模型在 设置 → 本地环境 一键下载,全部本机运行、数据不出设备;运行引擎(sherpa-onnx / audio.cpp)会按所装模型自动下载。

语音识别(ASR)

模型 大小 适用场景
SenseVoice(int8) 163MB 中英日韩粤,自动标点;文件转写、录音笔记、字幕工坊的识别源,CPU 秒级,低配机器首选
Confucius4-R2T2(q8) 2.5GB 30 语自动检测,支持热词与上下文;实时语音识别(边说边出字)首选;无时间戳,不适合出字幕

语音合成(TTS)

模型 大小 适用场景
Kokoro 82M 349MB 53 个内置音色(含 8 个中文)中英混读,CPU 秒级;不支持克隆——朗读、播客最轻量的起点
Chatterbox 0.5B(q8) 2.1GB 零样本音色克隆,英文为主 19 语(无中文),需真人参考音频
Qwen3-TTS 0.6B 克隆(q8) 2.0GB 参考音频复刻音色的低配变体,磁盘与内存占用更小
Qwen3-TTS 1.7B 克隆(q8) 2.7GB 3 秒参考音频复刻音色,克隆配音的主力
Qwen3-TTS 预置音色(q8) 2.8GB 9 个预置音色 + 自然语言风格指令,不想录参考音频就用它
IndexTTS 2.5(q8) 3.5GB 音色克隆 + 情感文本控制,中英日西阿多语——中文情感配音
VoxCPM2 2B(q8) 3.0GB 30 语含 9 种中文方言;克隆、无参考直读与音色设计(文字描述造音色),48kHz 输出

命令行

同一个可执行文件也是 CLI,适合脚本与自动化(加 --json 输出机器可读结果):

voxbox tts "你好,voxbox" --out hello.mp3            # 文本转语音
voxbox asr meeting.mp3 --out transcript.txt          # 音频转文字
voxbox podcast "聊聊本地大模型" --speakers <音色A>,<音色B> --out podcast.mp3
voxbox separate song.mp3 --engine gsgc --stems both  # 人声伴奏分离(免费通道)
voxbox translate "你好,世界" --to en --out en.txt    # 机器翻译

完整命令与参数见 CLI 完整参考,或 voxbox <命令> --help。

让 AI Agent 接入

voxbox skill install   # 把能力说明装进本机 agent(Claude Code / WorkBuddy / CodeBuddy)
voxbox mcp             # stdio MCP server,Claude Code 等 MCP 客户端可直连

MCP 接入配置见 docs/mcp.md。

云端凭证

平台 需要什么 覆盖能力
火山引擎 APP ID + Access Token,或新版 API Key 合成 / 识别 / 播客 / 翻译 / 妙记
火山 AI MediaKit MediaKit API Key(独立) 人声背景分离
千问 / 小米 / 智谱 各一个 API Key 合成与识别备选引擎
OpenRouter 一个 API Key(openrouter.ai 创建) Gemini TTS 合成备选引擎
MVSep API Token(mvsep.com 注册获取) 120+ 分离算法
格式工厂 / 转换猫 无需凭证 免费分离与格式转换
本地推理 无需凭证 离线合成与识别

凭证、任务与产物都保存在本机数据目录,不上传、不同步;只有你主动使用的云端能力才会把内容发给对应服务商。

给开发者

make all     # 构建前端 + 编译单二进制到 bin/voxbox
make test    # Go 测试全量
make dist    # 交叉编译五个平台打包到 dist/

单二进制:前端产物 go:embed 内嵌,SQLite 存状态,零外部依赖,可交叉编译。技术栈:Go(gin / gorm / cobra)· React 19 + TypeScript + Vite + Tailwind CSS v4 · Tauri 2(桌面壳)。

  • UI 设计规范:色彩 / 字体 / 间距 / 组件规格
  • MCP Server:voxbox mcp 接入配置与工具清单
  • JSON 输出契约:--json / MCP 输出的字段与稳定性承诺
  • 桌面版发布走 GitHub Actions(.github/workflows/desktop-release.yml),本地构建 make desktop

Star History

Star History Chart

License

MIT.

About

语音处理工具箱,支持豆包语音、千问、小米、智谱、minimax、OpenRouter等平台接入。也可接入 indexTTS-2.5, QWen3-TTS等本地语音识别语音合成大模型。

Topics

Resources

Code of conduct

Contributing

Security policy

Stars

4 stars

Watchers

0 watching

Forks

Releases

Packages

Used by

Contributors

Languages