可复现的 AI 声音克隆 A/B 测试方法
用受控输入、明确试听指标、重复运行和诚实报告比较模型、参考、脚本、情绪或语速,同时避免伪造 MOS。
指南信息
如果 A 与 B 同时更换参考、脚本、情绪、pace 和模型,你可以听到差异,却无法解释差异来自哪里。真正有用的 A/B 测试围绕一个问题设计。
IndexTTS Online 的 Voice Lab 用于更容易地做受控模型比较,同样的方法也适用于参考录音、文本格式、情绪和语速。
生成前先写下测试问题
好问题应该很窄,例如:哪一个参考让声音身份更稳定?句号是否比逗号产生更合适停顿?相同英文/中文输入下哪个模型更适合当前任务?较慢 pace 是否提高这段文字可理解度?
“哪个设置最好”“哪个最像真人”都太模糊。
定义固定变量
模型 A/B 应记录 reference file、target text、target language、emotion、pace、model A/B、日期和重复次数。两边使用相同参考和文本。
能力不对等时不要假装对称。本站 IndexTTS2 hosted 路径聚焦英文/中文,IndexTTS 2.5 额外暴露日语、西班牙语、阿拉伯语以及 pace controls;日语可以评估 2.5 能力,但不能伪造成 IndexTTS2 的公平直接 A/B。
使用干净且已授权的参考
一个说话者、低噪声、无音乐、环境稳定。公开 benchmark 还应记录来源和权利;未经明确许可不要拿客户或私有用户参考做公开样本。
上游官方参考与本站自己生成的 hosted 输出应清楚区分。
目标文本要回答当前问题
身份/自然度测试使用普通连续语音;标点测试只放一个关键停顿;数字测试用简短数字行;多语言文本应由胜任目标语言的人写或审。
除非就是测试目标,不要把姓名、缩写、日期、情绪对白和代码 token 全塞进所谓“通用测试”。
重要结果重复运行
生成系统会有变化。一个特别好或特别坏的 take 不代表普遍结果。重要决定至少重复 finalists 两三次,并用清楚文件名保存 run。
尽可能盲听
第一次审核可以临时把文件重命名为 A/B,写完备注后再揭示模型。团队审核时,让每个人先独立记录选择再讨论,减少标签和从众偏差。
分开试听维度
不要只写“更好听”。至少区分 Speaker identity、Intelligibility、Pronunciation、Prosody、Stability、Artifacts 和 Task fit。这样备注才可执行。
谨慎使用评分尺度
内部 1–5 分可以帮助制作团队,但不会自动成为科学 MOS。Mean Opinion Score 通常意味着明确 listening-test methodology 和多听众聚合。没做正规研究时,应称为 internal review score、reviewer preference、production note 或 sample comparison。
不要编造 latency benchmark
延迟受队列、provider、网络、文本长度、cold start、重试和地域等影响。发布延迟数据必须说明起止点、样本量、region、文本长度、日期和失败处理;否则“模型 X 快 30%”不是可信结论。
分开上游证据和第一方测量
Benchmark 页面应区分:本站 hosted product facts、模型作者发布的 upstream findings、本站真正执行的 first-party measurements。不要让上游数字看起来像本站复现结果。
记录准确测试日期
模型、provider、基础设施和控制都会变化。公开测试应记录日期、模型标识、参考来源、目标文本、语言、控制、run 数量与评价方法。
测试真实生产任务
有声书用真实段落,UI prompt 用短指令,西语本地化就测真实西语旁白。通用 demo 中最好,不等于你的任务最好。
模型 A/B 示例
问题:同一英文 narrator reference 下哪个模型更稳定?固定同一 voice_01.wav、同一文本和 neutral/follow-reference 情绪;只改模型;每个模型跑三次;分别审核身份、发音、prosody、伪影与偏好。这个结果只支持当前 case,不能证明一个模型普遍更优。
参考 A/B 示例
固定模型、文本、语言、情绪和 pace,只替换 reference。比较后用第二段目标文本复核赢家,再保存项目基线。
可复用模板
记录 Case ID、Question、Reference source/rights、Target text、Language、Model/settings、Variable、Runs、Listening criteria、Reviewer notes、Decision 和 Test date。表格、Markdown 或数据库都可以,关键是持续一致。
测试没有明确赢家也是真结果
如果 A/B 都很好,或重复 run 反转首轮偏好,应直接记录“本测试下没有一致可听优势”,然后按语言、控制、成本或工作流简洁度选择。不要强行制造结论。
最终规则
问一个窄问题;一次只改一个变量;控制参考和文本;重要 run 要重复;从多个维度听;不要把偏好分伪装成 MOS;记录来源与日期;分离上游与本站实测;不强做不支持的语言/模型对比;公开限制条件。
A/B 的价值来自减少猜测,而可信度来自克制:只声明实验真正支持的内容。