合规与免责声明
本项目及其衍生用法须遵守《互联网信息服务深度合成管理规定》及相关法律法规。请勿用于冒充他人、欺诈、侵犯他人声音权/肖像权或任何违法违规用途。使用本工具训练、转换他人声音前,须取得本人授权。因不当使用产生的责任由使用者自负。本文仅作为开源项目本地部署的技术学习记录。
什么是 RVC 变声器?
RVC(Retrieval-based Voice Conversion) 是一款基于 VITS 模型 的开源 AI 语音转换框架。简单来说,它可以把一个人的声音转换成另一个人的声音,同时完整保留原语音的情感、语调和节奏特征。
与传统变声工具通过改变音高、产生严重机械感的方式不同,RVC 的转换效果更显自然,几乎听不出“变声”的痕迹。它的核心能力是声音转换,通过提取源音频的特征向量并映射到目标声音模型上进行推理,从而输出高度相似且自然的目标人声。
RVC 的使用门槛并不高。它提供了一个直观的 GUI 图形界面,所有操作都在界面内完成,不需要用户编写任何代码。该项目在 GitHub 上非常活跃,拥有极其丰富的预训练模型与社区资源。目前最新的 RVC v2 版本相比 v1 版本在音质和推理速度上都有了明显的提升,底模使用了大量高质量音频数据训练,支持中英文等多语言输入。
RVC 主要支持以下应用场景:
- 实时变声: 适用于直播、游戏、语音通话等场景。
- AI 翻唱: 生成高品质的 AI 歌手翻唱作品。
- 模型训练: 仅需少量样本,即可快速训练出专属的全新声音模型。
一、 RVC 变声器安装硬件需求与显卡检测
在开始部署之前,请先确认您的 PC 是否满足 2026 年的标准硬件配置:
1. 硬件配置要求
| 硬件组件 | 最低配置要求 | 推荐配置要求 |
|---|---|---|
| 显卡 (GPU) | NVIDIA GTX 1060 6G 或 AMD RX580 8G | NVIDIA RTX 3060 8G 及以上(支持30/40/50系显卡) |
| 处理器 (CPU) | Intel 酷睿 / AMD 锐龙四核心以上 | Intel 12代酷睿 i5 或 锐龙 7000 系列以上 |
| 内存 (RAM) | 8GB RAM 以上 | 16GB / 32GB RAM 以上 |
| 存储空间 | 预留至少 20GB 可用空间(用于存放整合包及多套模型) | 20GB 以上(推荐固态硬盘 SSD) |
| 操作系统 | Windows 10/11 64-bit | Windows 10/11 64-bit |
| 网络环境 | 用于基本使用的常规网络 | 需稳定连接 GitHub 以获取最新权重更新 |
重要说明: 虽然 CPU 可以运行 RVC,但实时变声强烈推荐使用 NVIDIA 显卡。AMD 和 Intel 的显卡由于缺乏 CUDA 生态,通常使用 DirectML 推理,其延迟会明显偏高。若要实现极低延迟、无卡顿的实时变声体验,NVIDIA RTX 20 系列及以上显卡是最佳选择。
2. 小白如何一键检测自己的显卡型号?
如果你不知道自己电脑的显卡制造商,请按照以下步骤检查:
- 按下键盘上的
Win + R键,打开运行窗口。 - 输入
dxdiag并回车,启动 DirectX 诊断工具。 - 切换到 「显示」 标签页,查看“名称”和“制造商”一栏。
- 如果制造商显示 NVIDIA:请下载 NVIDIA 专属版 整合包。
- 如果显示 AMD、Intel 或其他(如集成显卡):请下载 AMD/Intel 兼容版 整合包。
二、 核心算法对比:为什么无脑推荐 RMVPE?
在 RVC 中,不同算法对声音的“F0(基频)预测”方式不同,直接决定了变声的延迟、音质和对环境噪音的抵抗力。
1. 主流 F0 预测算法直观对比
| 算法名称 | 建议场景 | 音质表现 | 资源占用 | 2026 推荐指数 |
|---|---|---|---|---|
| RMVPE | 实时变声 / 录音 | 极高(效果默秒全,最清晰) | 低(比 Crepe 显存占用更小,且不吃 CPU) | ⭐⭐⭐⭐⭐ |
| Crepe | 离线高质量翻唱 | 极高 | 高(吃显存,属于显存杀手) | ⭐⭐⭐⭐ |
| Harvest | 低配机器 / 备用 | 中等(说话防哑声好) | 中等(但 CPU 占用极大) | ⭐⭐ |
| PM | 实时翻唱 / 极低延迟 | 中等(嘈杂环境下差) | 极低(延迟最低,CPU/GPU 占用最小) | ⭐⭐ |
2. 深度算法特性详解
- RMVPE: 2026年无脑首选算法。它的音质和速度表现都非常优秀,推理速度不仅比 Harvest 和 Crepe 快,而且在显存占用上比 Crepe 更轻量,完全不消耗 CPU 资源。除非显卡极度落后,否则不要选择其他算法。
- Crepe: 虽然音质极好,但由于它极度消耗 GPU 资源,在 RMVPE 诞生后,在实时变声场景下基本上已沦为备用。
- Harvest: 这是一个非常经典的基频提取算法,声音饱满不易出现哑声。但它致命的缺点是 CPU 占用极高。在实时变声时,需要手动调整增加“Harvest 进程数”来分摊系统负载,从而降低延迟。适合单显卡玩家在打游戏的同时,想要维持低延迟变声的备用方案。
- PM: 对应 RVC v1/v2 的早期版本算法,CPU 和延迟开销极小。虽然在唱歌时表现尚可,但在日常嘈杂的说话环境中,其表现和抗噪能力较差。
三、 RVC 变声器一键整合包下载与解压安装
官方和社区通常会针对不同的硬件架构,将复杂的 Python 依赖打包,推出解压即用的一键整合包。
1. 选择适合你的整合包版本
- NVIDIA 专属版 (
RVCxxxxNvidia.7z): 适合拥有 NVIDIA 独立显卡(支持 CUDA 加速)的用户。该版本实时推理速度极快,延迟最低,是实时语音变声和 AI 爱好者的首选。 - AMD/Intel 兼容版 (
RVCxxxxAMD_Intel.7z): 适合只有 AMD 显卡、Intel 显卡或仅有 CPU 的笔记本核显用户。该版本使用 DirectML 或 CPU 推理,速度稍慢,但对于非实时翻唱和声音转换来说完全够用。
2. 安装与启动保姆级步骤
- 彻底关闭显卡硬件加速(针对 10系 / 16系等老卡用户优化): 在 Windows 系统中,建议先关闭系统自带的“硬件加速 GPU 计划”以避免运行冲突。操作方法:在开始菜单搜索并打开「图形设置」 -> 关闭「硬件加速 GPU 计划」 -> 重启电脑。
- 纯英文路径解压: 将下载好的
.7z压缩包解压。注意:解压目录必须是纯英文路径(例如D:\AI\RVC_Project或D:\RVC),绝对不能含有中文或特殊字符。因为 RVC 底层的 Python 脚本如果检测到中文路径,会导致加载失败或程序运行异常。 - 双击启动脚本: 进入解压后的文件夹:
- NVIDIA 显卡用户双击
go-realtime-gui.bat。 - AMD/Intel 显卡及 CPU 用户双击
go-realtime-gui-dml.bat。
- NVIDIA 显卡用户双击
- 等待控制台加载: 此时会弹出一个黑色 CMD 窗口,启动脚本会自动检测运行环境、加载依赖和模型文件。
- 提示:部分 10 系和 16 系老卡用户在 CMD 控制台可能会卡住,这时需要在控制台上敲一下回车键即可继续加载。
- GUI 界面自动开启: 当控制台刷出一串本网地址信息后,浏览器会自动弹出 RVC 的 GUI 窗口,即可开始使用。
四、 声音模型获取与文件安装规范(weights与logs)
整合包自带了一些基础的声音模型,如果想变出更丰富的音色,需要去社区下载第三方模型。
1. 2026 推荐的高质量声音模型库
- ModelScope 魔搭社区(国内推荐): 阿里云旗下的 AI 模型社区(
modelscope.cn),国内免翻墙访问且速度极快,中文相关的 RVC 模型种类非常丰富。 - Voice-Models(海外推荐): 它是目前全球最大的开源 RVC 声音模型库(
voice-models.com),收录了超过 19 万个高品质声音模型,支持在线一键试听预览,是寻找二次元、名人及歌手模型的首选。
⚠️ 合规提醒: 下载和使用第三方声音模型时,请务必确认其授权情况。切勿使用未经授权的真实人物、明星、主播的声音模型从事任何商业化或公开传播活动,以免侵犯他人的合法声音权益。
2. 模型核心文件说明与存放位置
下载一个 RVC 声音模型后,解压通常会看到两个格式不同的核心文件,千万不要放错文件夹:
RVC 根目录/
├── weights/
│ └── [你的模型名].pth <-- 存放所有 .pth 音色权重文件
└── logs/
└── [你的模型名]/
└── [你的模型名].index <-- 存放与之配对的 .index 特征索引文件
.pth文件(权重文件): 存储目标声音的全部音色特征,是变声最基础的文件。必须放入 RVC 项目根目录下的weights文件夹中。.index文件(特征索引文件): 基于 FAISS 技术,在推理时负责对比输入的声学特征,并纠正可能出现的音色偏移。必须放入 RVC 目录下的logs/你的模型名/文件夹中。特别注意: 缺少.index文件虽然软件依然能跑,但转换出来的声音相似度会大打折扣。若确实找不到.index文件,可参考下文将 Index Rate 拉到0强制使用。
五、 RVC 变声器基础使用流程与参数微调秘籍
1. 极简变声操作四步法
- 选择模型: 打开 GUI 界面,点击“刷新模型列表”,在下拉菜单中正确选择你刚才存放的
.pth权重文件和对应的.index索引文件。 - 选择音频设备:
- 输入设备(Input): 选择你电脑上正在使用的物理硬件麦克风。
- 输出设备(Output): 选择你安装的虚拟音频线的输入线路(例如
VoiceMeeter Input (VB-Audio Voi (MME)))。
- 调整核心参数: 根据性别和设备配置,微调核心参数(推荐参数见下表)。
- 启动转换: 点击界面左下角的 「开始音频转换」 按钮。当黑色的 CMD 窗口开始不断刷出数值、变声时间开始跳动时,说明实时变声系统已经搭建成功。
2. 核心参数推荐指南
想变出最自然、无机械感、低延迟的声音,必须合理配置以下参数:
| 参数名称 | 物理意义与原理 | 推荐设置 |
|---|---|---|
| 音调设置 (Pitch) | 改变输入音频的音高基准,数值越高越女性化,越低越男性化。 | 男变女: +10 至 +12 女变男: -10 至 -12 同性别变声: 0 左右微调 |
| Index Rate | 控制“底模音色”与“目标模型音色”的融合强度。偏左偏向底模,偏右偏向目标模型。 | 通常推荐: 0.2 至 0.5若无 .index 文件或配置较低导致卡顿,强制拉到 0。 |
| 采样长度 | 决定变声的缓冲块大小,直接决定了变声的监听延迟。 | 尽量调低(如 128 / 256)。若出现“机关枪”般的卡顿,说明推理速度跟不上,必须调高此数值。 |
| 额外推理时长 | 在当前音频前额外截取推理的上下文长度,用于改善咬字与口齿识别。 | 建议设置为 1 以上 3 以内。留出至少 1s 的缓冲,能极大地改善咬字,但会略微增加 CUDA 显存占用。 |
| 响应阈值 | 设置声音输入的门槛,低于此响度不进行变声,可防止呼吸声和底噪被误变。 | 建议直接拉满至 -60,然后搭配外部降噪方案或使用 RVC 自带的降噪功能。 |
| Harvest 进程数 | 决定 Harvest 算法最多占用多少系统 CPU 线程(仅在 Harvest 算法下生效)。 | 如果需要兼顾打游戏,建议不大于 4。调高可以降低延迟但极度吃 CPU,调低则延迟增加。 |
| 淡入淡出长度 | 影响相邻音频切片过度时的平滑度与延迟。 | 建议根据监听耳返的实际听感在 0.1 到 0.15 之间微调体验。 |
六、 虚拟声卡多通道保姆级教程:以 Voicemeeter Banana 为例
RVC 变声器本身并不能直接让微信、QQ 或游戏里的人听到你变声后的声音,它需要一根“虚拟管道”将转换后的声音发送给其他软件。
虽然 VB-Cable(单通道)很轻量,但为了实现无卡顿、高音质、能边打游戏边变声、还能实时开耳返监听,我们强烈推荐使用多通道调音台 Voicemeeter Banana(香蕉版)。
1. 通俗理解 Voicemeeter 的“水管模型”
把音频流看作是水流,Voicemeeter Banana 就是一个多向水管分流器:
- “硬输入 / 硬输出”:指实际摸得着的硬件,如你的物理麦克风、USB 独立声卡、物理耳机、扬声器。
- “软输入 / 软输出”:指电脑里看得见摸不着的虚拟驱动,如音乐播放器、QQ语音、游戏音效、变声软件等。
2. 第一步:软件下载与系统声音面板配置
- 下载 Voicemeeter Banana,运行并点击右下角的
Install进行安装。安装成功后,务必重启电脑以保证虚拟驱动加载完全。 - 打开 Windows 系统右下角的声音控制面板,分别切换到播放和录制选项卡,进行如下配置:
- 「播放(Playback)」选项卡: 找到不带 AUX 的
VoiceMeeter Input (VB-Audio VoiceMeeter VAIO),将其右键设为 “系统默认设备”。此时电脑里的所有系统声音(游戏、网页、播放器)都会流入 Banana 调音台的软输入通道。 - 「录制(Recording)」选项卡: 找到不带 AUX 的
VoiceMeeter Output (VB-Audio VoiceMeeter VAIO),右键将其设置为 “系统默认设备”。这就相当于把 Banana 调音台的 B1 虚拟输出口变为了你的默认系统麦克风,后续 QQ、Discord、游戏等通讯软件会自动抓取这个变声后的声音。
- 「播放(Playback)」选项卡: 找到不带 AUX 的
3. 第二步:在 Banana 面板上做路由分流(核心步骤)
双击打开电脑中的 Voicemeeter(注意启动不带任何其他后缀的程序),按照下图逻辑配置:
- 设置监听输出(耳返硬件): 点击右上角的
A1硬件输出按钮,在下拉菜单中选择你的物理耳机或扬声器。驱动选择技巧: 下拉列表中会看到同一个设备有WDM、KS、MME开头的不同驱动。- 优先选择
KS或WDM驱动(例如KS 128 samples),因为其缓冲区 Samples 样品数更小,监听延迟最低,不容易失真。 - 通常不推荐
MME,因为它的缓冲区数值大、耳返延迟高。若某种驱动出现爆音或报错,再退而求其次选择其他驱动。
- 优先选择
- 设置物理麦克风输入: 点击左侧
HARDWARE INPUT 1下方的Select Input Device,选择你的物理麦克风(同样建议选择WDM或KS驱动)。 - 将麦克风的声音发送给 RVC: 由于你的物理麦克风接在了
HARDWARE INPUT 1,声音进调音台后,在下方路由开关中:- 只勾选
B1(勾选 B 表示将声音流向软输出虚拟麦克风,让第三方软件听到)。 - 如果你想在不启动变声器时监听自己原本的声音,可以勾选
A1。但在使用 RVC 变声时,必须取消勾选 A1,否则你会听到自己的原音和 RVC 变声重叠。
- 只勾选
- 开启变音耳返(即时听到变声效果): 在 RVC 变声器界面上,将 输入端(Input) 选择为你的物理麦克风,输出端(Output) 选择为
VoiceMeeter Input (VB-Audio Voi (MME))。 在 Banana 面板中,开启A1即可在耳机里实时听到变声后的效果。
4. 妙用 Banana 的压缩器与门限器
在 HARDWARE INPUT 1(物理麦克风输入)的调节窗口中,有两个非常实用的粉色标记旋钮:
- 1号 压缩器 (Compressor): 压缩前后的音频电平差会变小,相当于把声音小的地方放大、大的地方调匀。许多吃鸡玩家利用它来放大游戏内的脚步声,非常好用。
- 2号 门限器 (Audibility/Gate): 相当于给声音进水管设置了一个门槛,声音响度高于门槛才允许通过,低于门槛的噪音则直接被拦截。它可以起到非常好的降噪、屏蔽键盘和呼吸声的效果。
七、 如何训练属于你的 RVC 声音模型?
如果您想变出自己或者特定声音模型的音色,可以通过 RVC 的“训练”选项卡,按照以下步骤建立专属的 .pth 与 .index 文件:
- 高品质数据采集: 准备大约 300 段左右、每段 10 秒左右 的高质量音频干声。要求声音清晰、无背景音乐、无嘈杂噪音。
- 音频预处理: 将采集的干声音频放入训练路径,在“训练”选项卡中选择对应的目标采样率(2026年主流高音质推荐选择
40k或48k)。 - 设置训练参数:
batch_size(批大小): 推荐先设置为12。如果显卡在训练时爆出Cuda out of memory报错,可逐步调低至8、6或4。Total Epoch(训练轮数): 建议设置为200轮以上。轮数过低声音会不像、电音感强,轮数过高可能会出现过拟合。
- 生成特征检索: 训练结束后,务必点击“特征检索”选项卡中的生成按钮,确保系统生成了配套的
.index特征索引文件。这是提升音色还原度和音质相似度的核心所在,千万不能漏掉!
八、 2026 最新常见错误排查 (FAQ)
运行 RVC 时出现 Cuda out of memory 报错怎么解决?
推理时: 说明显卡显存吃紧,请关闭浏览器、后台游戏等高显存占用的程序,或者在 RVC 参数中略微调低 “额外推理时长”(减小 CUDA 占用)。
训练时: 在训练选项卡中将 batch_size 从 12 往下调(调成 8, 6 或 4)。
变声出来有极强的电子感、机械感、不自然?
检查是否无脑勾选了 2026 推荐的 RMVPE 算法。
检查输入的物理麦克风增益是否过大,导致输入源音频失真。
检查是否有正确加载 .index 索引文件,并将 Index Rate 调整在 0.2 - 0.5 之间。
双击 go-realtime-gui.bat 闪退,或者卡在 CMD 控制台怎么办?
确保你的整合包文件夹解压在 纯英文路径下(如 D:\RVC)。如果路径带有任何中文或空格,底层脚本一定会启动失败。
如果使用的是 10系 或 16系 的旧款 NVIDIA 显卡,CMD 可能会暂停响应,请点击黑窗口并敲击一下键盘上的“回车(Enter)”键即可继续加载。
确认是否已经按照教程在 Windows「图形设置」中关闭了“硬件加速 GPU 计划”。
运行 Voicemeeter Banana 安装报错或者无法发出声音?
如果弹出类似的报错提示,通常是因为你之前在系统里安装过其他版本的 Voicemeeter。请必须先去控制面板彻底卸载旧版本,重启电脑后,再重新运行安装香蕉版。
调试完成后,如果声音有严重的爆音或撕裂感,请在 A1 输出菜单中调整 Samples 样本数值,或在 KS / WDM / MME 驱动之间切换(优先推荐 WDM / KS 驱动,延迟最小)。
