Zinn Hub
0
你的购物车
0

一览

关于此服务的关键详情,帮助您做出决定。由 Zinn Hub 生成,非卖家生成。

AI模型类型

RVC(基于检索的语音转换)
使用 RVC 架构和 RVMPE 方法——被认为是最高质量的 F0 方法——以及 0.7–0.9 的检索率,可实现强大的人声口音再现。

数据集要求

20–25 分钟 WAV,无需调音
您的训练音频必须是原始、未经处理的 WAV 文件(无自动调音或人声调音),通过 Google Drive 或直接聊天以 ZIP/RAR 格式上传。

处理管道

Python MDX NET HQ + 3 方法
音频通过 Python MDX NET HQ Main 使用 MDXVR、ARCH、DEMUCS 和 ENS MODE 进行处理,以便在模型训练开始前进行源清理。

周转时间

模型在10小时 – 3天内准备就绪
模型处理需要 10 小时到 1 天,基本套餐的交付期为 3 天。加速和高级升级将交付期缩短至 2 天。

您将收到

格式:
数字文件
Cloud Link
音频文件
源文件
交付方式:
订单经理
备注: 您的自定义 PTH 模型文件将通过订单管理器或共享云链接交付,具体取决于文件大小。VO 录音将以高质量音频文件形式交付。请确保您的数据集在提交前符合 WAV 格式和 20–25 分钟的时长要求——这直接影响模型质量和处理时间。

完整描述

无论您是音乐制作人、内容创作者、配音演员还是开发者,定制的AI语音模型都能让您以任何目标声音——您自己的、角色的或艺术家的风格——生成逼真的人声输出。此服务提供一个完全训练好的RVC(基于检索的语音转换)模型,该模型基于您提供的音频数据集,并使用专业工具在专用硬件上进行处理。

每个模型都使用 Python MDX NET HQ Main 和三种处理方法进行训练,以获得最干净的源音频。AI 模型本身使用 RMVPE 方法构建——该方法被广泛认为是最高质量的 F0 估计方法——检索率为 0.7–0.9,以保留和加强目标声音的独特口音和特征。结果是一个自定义的 PTH 模型文件,可用于您自己的工作流程。

数据集准备过程包括源语音清理,以在训练开始前去除任何伪影、噪音或溢出。您的音频必须以干净的 RAW WAV 文件形式提供——未应用人声调音、音高校正或自动调音——并且持续时间应在 20 到 25 分钟之间,以获得最佳模型质量。数据集可以通过云链接或直接在订单聊天中以 ZIP 或 RAR 存档形式交付。

除了模型创建,此服务还涵盖人声分离任务(乐器移除和人声移除)以及定制的画外音 (VO) 录音。VO 工作使用专业录音室设备进行现场表演:铁三角 AT4040 电容麦克风、Arturia MiniFuse 2 音频接口、ATH-M40X 监听耳机和 Aston Halo 隔离罩——确保广播级质量。VO 角色和艺术家风格的声音适用于男性和女性。如果您有特定的角色、艺术家或个性,请在下订单时提及。

工作流程中应用的处理方法包括MDX、VR Arch、Demucs和ESNM Mode,使团队能够灵活选择最适合您特定源材料的分离方法。

注意:人声混合请求需要单独费用——如果适用,请在下单前与我联系。

**这适用于谁?**
想要创建原创 AI 人声演绎的音乐制作人、构建角色声音的游戏开发人员或内容创作者、想要个人 AI 克隆以进行快速原型制作的配音演员,以及探索 AI 音乐和语音技术的爱好者。

**工作原理:**
1. 下订单并上传您清理过的 WAV 数据集(20–25分钟,无需调音)。
2. 团队处理并清理您的源音频,然后使用 RMVPE 训练您的 RVC 模型。
3. 您的最终 PTH 模型文件将在约定时间内交付。

从收到并批准您的数据集起,模型处理通常需要 10 小时到 1 天。

查看选项并购买 — 起价 $40.00

✓
经过审查的专业人士
每位 Zinner 在加入平台前都会经过审查和批准。
✓
质量保证
所有服务均有我们的质量保证承诺支持。
✓
安全支付
您的付款受保护,直到您批准交付的工作。

比较套餐

特色标准Boost高级
交付时间3 天2 天2 天
修订111
自定义 RVC AI 语音模型 (PTH 文件)✓✓✕
长达 25 分钟的训练数据集✓✓✕
包括源声音清洁✓✓✕
RMVPE 方法 — 最高质量的 F0 估计✓✕✕
强语音角色的检索率 0.7–0.9✓✕✕
支持人声演唱✓✕✕
标准版包含的所有功能✕✓✕
优先队列 — 2天内交付✕✓✕
RMVPE方法,检索率0.7–0.9✕✓✕
Boost 中的所有内容✕✕✓
定制配音录制(您选择的角色或艺术家声音)✕✕✓
使用 AT4040 麦克风、Arturia MiniFuse 2 和 Aston Halo 隔离罩录制✕✕✓
提供男性或女性配音风格✕✕✓
包含乐器或人声去除✕✕✓
广播级音频质量✕✕✓

作品集

卖家与此 Zinn 相关的工作示例。

使用RVC创建自定义AI语音模型

使用RVC创建自定义AI语音模型

额外信息

我的流程

步骤 1 — 数据集审查:在开始处理之前,将审查您的 WAV 数据集的长度、格式合规性和音频清晰度。
步骤 2 — 源语音清理:使用MDX、VR Arch、Demucs和ESNM模式分离方法去除噪音、伪影和溢出。
步骤 3 — RVC 模型训练:使用 RMVPE F0 方法和 0.7–0.9 的检索率,对清理后的数据集进行自定义 AI 语音模型训练。
步骤 4 — 交付:您的 PTH 模型文件(以及任何适用的 VO 录音)将在商定的时间内通过订单管理器交付。

我使用的工具

AI 模型训练:Python MDX NET HQ Main — RVC,采用 RMVPE F0 方法,检索率 0.7–0.9
音频分离:MDX、VR Arch、Demucs、ESNM Mode
录音设备:AT4040电容麦克风,Arturia MiniFuse 2接口,ATH-M40X耳机,Aston Halo隔离罩

完美适合

谁受益最大:制作 AI 人声渲染的音乐制作人|构建角色声音的游戏开发者和内容创作者|原型化个人 AI 声音克隆的配音演员|探索 AI 音乐和语音合成的艺术家和业余爱好者|任何需要专业人声隔离或移除的人

常见问题

您的数据集必须是 WAV 文件格式,总时长在 20 到 25 分钟之间。请确保录音是原始录音,没有应用人声调音、音高修正或自动调音 — 这些会显著降低模型质量。

您可以直接在订单聊天中以 ZIP 或 RAR 存档的形式上传文件,或通过云存储链接(例如 Google Drive)共享。两种方法同样有效。

一旦您的数据集收到并获批,处理通常需要 10 小时到 1 天。总交付时间包括此处理窗口,因此请预留完整的规定交付期。

您将收到定制的PTH模型文件,您可以将其加载到您自己的RVC兼容环境或软件中。如果您还订购了画外音,您将收到录制的音频文件。

RMVPE(鲁棒人声音高估计模型)是目前RVC模型训练中使用的最高质量的F0音高检测方法。与其他方法相比,它能产生更准确、更自然的语音转换,尤其适用于歌唱应用。

是的——高级套餐包括定制的配音录制。您可以请求男性或女性声音,并指定艺术家、角色或您心目中的个性风格。下单时请包括这些详细信息。

人声混合结合了两个或更多声源的元素。这是一项单独的服务,有其自己的费用,不包含在此处列出的任何套餐中。如果您需要此服务,请在订购前留言。

每个套餐都包含一次修订。如果输出不符合商定的范围,请通过订单聊天提出,团队将予以解决。质量下降最常见的原因是音频数据集包含调音、噪音或短于建议的20分钟——因此,干净、充足的源材料至关重要。

客户评论

看看我们的客户对这个Zinn的评价

5.0
5评论
5 ⭐
5
4 ⭐
0
3 ⭐
0
2 ⭐
0
1 ⭐
0

谢谢,伙计!

优秀的产品和卖家——优于其他。对我的模型非常满意,现在可以做很多项目了!

他做的事情是最好的之一

很棒的工作

他一如既往地很棒!快速且专业!

只有购买过此产品的登录客户才能发表评论。

分类

Zinner 政策

制作任何自定义AI语音模型,包括文本转语音

只有购买过此产品的登录客户才能发表评论。

选项和订单

获取 Zinn Hub 应用

通知 · 更快访问 · 全屏

在浏览器中点击 分享

➜ 然后点击 "添加到主屏幕"