再現可能なAI音声クローニングA/Bテスト手法
model、reference、script、emotion、paceをcontrolled inputと正直な評価で比較し、架空のMOSを避ける方法。
ガイド情報
複数の入力を同時に変えたA/Bは、差は聞こえても原因を説明できません。良いテストは1つの狭い質問から始まります。Voice Labでも同じ原則を使います。
生成前にquestionを書く
「どちらのreferenceがspeaker identityを安定させるか」「commaよりperiodがpauseを改善するか」など、変更対象が明確な質問にします。「どの設定が最高か」は広すぎます。
control variablesを定義する
model A/Bならreference file、target text、language、emotion、pace、date、repeat countを記録し、モデル以外を固定します。
当サイトのIndexTTS2は英語・中国語を中心に提供し、IndexTTS 2.5は中国語、英語、日本語、スペイン語、アラビア語とpaceを提供します。片方にない言語やcontrolを、対称な比較のように扱いません。
きれいで許可されたreferenceを使う
1人、低ノイズ、BGMなし、安定環境を使います。公開テストではprovenanceとrightsを記録し、private customer audioを無断で使いません。
target textを質問に合わせる
identityなら普通のconnected speech、punctuationなら1つの意味あるpause、numberならその数値、多言語なら対象言語として自然な文を使います。
複数回runする
生成結果は変動します。重要な候補は2〜3回以上試し、case01-modelA-run1.wavのように保存します。
可能ならblind reviewする
最初の試聴ではA/Bへ一時的にrenameし、notesを書いた後にモデル名を明かします。teamでは各人が先に判断してからdiscussionします。
評価軸を分ける
Speaker identity、Intelligibility、Pronunciation、Prosody、Stability、Artifacts、Task fitを別々に評価します。「better」だけでは改善に使えません。
rating scaleをMOSと呼ばない
内部の5段階評価はproduction noteとして有用ですが、定義されたlistener studyと集計を行っていないならstandardized Mean Opinion Scoreではありません。
latency benchmarkを作り話にしない
queue、provider、network、text length、cold start、retry、regionが影響します。公開するならstart/end、sample size、region、text length、date、failure handlingを明示します。
upstream evidenceとfirst-party measurementを分ける
hosted product facts、model authorのupstream finding、自サイトで実際に測ったfirst-party dataを別々に表示します。
日付と設定を記録する
model、provider、infrastructure、controlは変わります。public testはtest date、model ID、reference provenance、text、language、controls、runs、evaluation methodを記録します。
実際のproduction taskも試す
audiobookなら代表paragraph、UI promptなら短いinstruction、Spanish localizationなら実際のSpanish narrationを試します。
model A/B例
同じEnglish narrator reference、同じtarget sentence、同じneutral/follow-reference emotion、適用可能な同じpaceで、modelだけ変更し、各3runをidentity、pronunciation、prosody、artifact、preferenceで比較します。このcaseの結果は普遍的優位性を証明しません。
reference A/B例
model、text、language、emotion、paceを固定してreferenceだけ変え、winnerを別のtarget sentenceでも再確認します。
reusable template
Case ID、Question、Reference/rights、Target text、Language、Model/settings、Variable、Runs、Criteria、Reviewer notes、Decision、Test dateを残します。
inconclusiveも正しい結果
A/Bが同等、repeatで勝者が変わる場合は「この条件で一貫したaudible advantageなし」と記録し、対応言語、control、cost、workflow simplicityで選びます。
最終ルール
狭いquestion、1変数、固定input、repeat、多面的なlistening、MOSの正しいラベル、provenance/date、upstreamとfirst-partyの分離、不公平なlanguage comparisonを避けること、limitationsの公開。この節度がA/Bの信頼性を作ります。