VoiceStudio电脑版

VoiceStudio电脑版

官方

系统:Android

日期:2026-09-29

类别:电脑软件

版本:v0.5.1

  • 详情
  • 相关
  • 评论

    最近挖到个叫 VoiceStudio 的开源神器,感觉像是给普通人的声音工厂装上了核动力引擎。以前搞配音或者做视频本地化,得把各种软件拼凑在一起,现在它直接把 TTS 合成和 ASR 识别全塞进去了,最绝的是那些引擎能一键切换,就像在厨房随手换锅炒菜,想追求极致效果还是图个快,随你心意。我试过它的零样本克隆功能,真的只要扔进去三到十五秒的录音,它就能把那个人的语气、甚至那种特有的小毛病都学得像模像样,不用去网上找那些花里胡哨的模型文件了。更有趣的是,你根本不需要提供声音样本,直接告诉它“我要一个三十岁带点伦敦腔、说话有点慵懒的女声”,它就能凭空捏造出来,这简直是把想象力变成了现实。对于想做有声书或者多角色对话的朋友来说,它能自动区分不同说话人并生成字幕,甚至还能把长篇 EPUB 文件直接变成章节分明的音频,这种一站式搞定全流程的能力,确实让原本需要专业团队的工作变得一个人也能轻松驾驭。不过看它的更新日志,技术党可能会觉得有点“硬核”,比如 Linux 启动器现在能提前发现缺失的插件防止崩溃,还有那些关于 Rust 回环和 Docker 服务的描述,听着像是在给服务器做体检。但在我看来,这些底层优化其实是为了让上面的创意功能跑得更稳,毕竟谁也不想因为软件闪退而打断创作灵感。它把复杂的音频处理逻辑藏在了简单的按钮后面,既保留了专业级的精细控制,比如逐行编辑字幕时间线,又给了小白用户“描述声音”这种低门槛的入口,这种平衡感在现在的 AI 工具里真的不多见。

    VoiceStudio是一款开源AI语音工作台,内置多TTS 语音合成引擎与ASR语音识别引擎,不同引擎之间支持一键自由切换,可根据场景灵活选择最优效果。零样本语音克隆只需3-15秒参考音频即可复刻音色,还原语气与发声特点,用户也可以直接通过描述年龄、口音、情绪生成全新人声。

    VoiceStudio电脑版同时整合音频转录、字幕生成、多人声区分、翻译与配音全流程,一站式完成视频本地化制作,让专业语音工作变得专业且高效。

    软件特色

    1、声音克隆

    放一段短片——我们会镜像它。通常三秒钟就够了。

    2、声音设计

    从一句话中构建新的声音。性别、年龄、口音、音调、情感。

    3、视频配音

    转录、翻译、重新配音。保留每个扬声器并对齐时间。

    4、故事

    多声部有声书——选角,放入剧本。

    5、有声书

    把长篇剧本或EPUB改编成有章节的有声书。

    6、配音画廊

    浏览按口音、年龄和风格设计的现成声音。

    7、文字记录

    将音频或视频转换为可编辑、可搜索的文本。

    VoiceStudio电脑版如何设计新声音

    1、打开VoiceStudio电脑版,进入【语音】界面;

    2、在输入框中输入声音要说的文本;

    3、选择一个预设或使用“描述你的声音”,写出可观察的特征,如 年龄范围、声带、速度、口音、能量和表达情境;

    4、我们可以进一步细化声音设置;

    5、最后选择【生成音频】即可;

    6、以上就是VoiceStudio电脑版设计新声音的操作教程。

    更新日志

    v0.5.1版本

    1、Model Catalogue 现在使用一个通风的办公区画布,采用更简单的窗格和发动机系列导航,取代嵌套卡片和滚动区域;

    2、Linux 源代码启动器现在能在 libxdo 和 GStreamer 音频插件缺失前发现它们,防止它们导致链接错误或中止的空白 WebKit 渲染器;

    3、语音输入现在从快捷方式传输到最终交付的单一原生输出会话,仅在未动过时恢复文本、HTML、图片或文件列表剪贴板,除非明确启用当前焦点插入,否则保持Wayland的复制安全,并且仅通过已安装的本地ASR模型;

    4、后端会立即绑定端口并实时报告启动进度——用步骤回答503,新的端点会列出每一步,同时PyTorch、API路由和数据库迁移在后台加载,所以“从步骤X开始”绝不会被误认为“死了”;桌面溅水器会讲述每一步;

    5、捆绑的 Rust 回环侧车可展示口述启动/停止/切换、聚焦输出会话、发现和 JSON-RPC;后端增加了版本化的流式事件和无依赖的CLI桥,用于Herdr、编码代理、编辑器、桌面应用和TUIs;

    6、无头的 NVIDIA 和 ROCm 机器现在可以作为仅限工作者的 Docker Compose 服务加入,无需公开的界面和持久协议 v2 注册;重新连接前将两台机器一起更新;

    7、每个桌面操作系统(macOS/Linux/WSL)或(Windows)均可实现一命令安装——URL为每个平台提供正确的脚本,Windows则获得源安装程序()和3操作系统CI烟雾;

    8、配音表中的逐行字幕管理:台词结束时间可与起始一同编辑(输入时间并拖拽时间线边缘现在路径相同),行与前一行及下一行合并(),且可以在任意行后插入新行;

    9、CI现在对热路径强制执行性能回归预算——运算计数测试将流式TTS固定为每句一个合成,缓存的dub混音为零重合成;快速路径保护在启用时不支持重新解码和⌈N/W⌉本地批处理调用。

    展开内容

    应用信息

    • 包名:
    • MD5:
    • 需要网络

    评分及评论

    4.5满分5.0分

    • ★
    • ★
    • ★
    • ★
    • ☆

    点击星星用来评分

    评论需审核后才能显示
    同类排行