音声クローニングのリファレンス長をテストする方法
「最適秒数」を決めつけず、短い・長いリファレンスを公平に比較するための再現可能なテスト方法。
ガイド情報
「リファレンスは何秒が最適か」に万能な数字はありません。長さは録音品質の1要素にすぎず、きれいな10秒がBGMや複数話者を含む長い音声より良い場合があります。
IndexTTS Onlineでは約3〜30秒の短いリファレンスを受け付けます。その範囲で、最大長を自動的に選ぶのではなくcontrolled testを行います。
まず同じ録音から比較する
同一人物・同一部屋・同一マイク・安定した話し方で30秒のmasterを録り、5、10、20、30秒のexcerptを作ります。全て自然な文境界で切ります。
target textを固定する
普通のconnected speech、2文以上、難しい名前や数字なし、既知の良い句読点を使います。
modelとcontrolも固定する
model、language、text、emotion、pace、product pathを同じにします。モデル比較は別実験にしてください。
具体的な評価項目
Speaker identity
全体で許可された話者らしさが保たれるか。
Clarity
子音や語境界が明瞭か。
Prosody
リズムが自然で、急ぎすぎたり不自然に平坦でないか。
Artifacts
buzz、metallic texture、重複音、変なbreath、背景特徴がないか。
Stability
重要な候補は複数回生成し、1回だけ良いのか継続して安定するのか確認します。
internal scoreをMOSと呼ばない
Identity、Clarity、Stabilityを1〜5で記録しても、それは制作チームの主観メモです。定義されたlistener studyを実施していないなら、standardized Mean Opinion Scoreとして公開しないでください。
短いリファレンスの利点
確認、trim、保存が簡単で、ノイズや別話者が入る機会も減ります。短くても安定しているなら長くする意味は小さいかもしれません。
長いリファレンスの利点
クリーンなら、母音、子音、pitch range、rhythmの例が増えます。ただし追加時間にBGM、笑い、別話者、環境変更が入るなら純粋な追加情報ではありません。
file lengthより実発話を見る
10秒ファイルに5秒無音があるなら、10秒の有効発話ではありません。過剰な無音と単純な反復を避けます。
styleも固定する
neutralとshoutingを同じreference内で混ぜると、length以外の変数が増えます。
別環境のclipを連結しない
room、mic、gain、compressionが違う音源の連結は純粋なlength testではありません。
4条件の実践テスト
30秒master → 5/10/20/30秒へexport → 同一paragraph → 同一設定 → 4出力生成 → 可能ならblind/random orderで聞く → identity/clarity/artifact/stabilityを記録 → 上位2つを再生成 → 最短で安定した候補を保存。
別のscriptでも確認する
1つの文章だけで偶然良い可能性があるため、語彙とリズムが違う第2scriptでもwinnerを確認します。
いつ止めるか
長くしても意味のある制作改善が出なくなったら止めます。数学的な最適秒数ではなく、再利用できる安定したreferenceを見つけることが目的です。
Voice Labとの関係
モデルA/Bではreferenceとtarget textを両側で完全に同じにします。reference lengthとmodelを同時に変えると原因を分けられません。
原則
「30秒が常に最良」「5秒で全員十分」という普遍的主張はしません。最もクリーンで代表的で、対象プロジェクトで安定するreferenceをcontrolled testで選ぶのが実用的です。