Método reproducible de pruebas A/B para clonación de voz con IA
Compara modelos, referencias, textos, emoción o ritmo con variables controladas y reportes honestos sin inventar MOS.
Detalles de la guía
Si A y B cambian referencia, guion, emoción, pace y modelo a la vez, puedes oír una diferencia pero no explicar su causa. Una buena prueba responde una pregunta estrecha.
Escribe la pregunta antes de generar
Ejemplos: ¿qué referencia mantiene mejor la identidad? ¿Un punto crea una pausa más útil que una coma? ¿Qué modelo funciona mejor para esta frase inglesa/china con los mismos inputs?
Define variables de control
Registra referencia, texto, idioma, emotion, pace, modelo, fecha y número de repeticiones. En un A/B de modelos, cambia solo el modelo.
La ruta alojada de IndexTTS2 se centra en inglés y chino. IndexTTS 2.5 expone chino, inglés, japonés, español y árabe, además de pace. No presentes una capacidad ausente como comparación simétrica.
Usa una referencia limpia y autorizada
Un hablante, poco ruido, sin música. Para ejemplos públicos, documenta procedencia y derechos y no publiques audio privado de usuarios sin permiso explícito.
Elige texto que responda la pregunta
Para identidad usa habla normal; para puntuación una pausa; para números un caso numérico; para multilingüe texto natural revisado en ese idioma.
Repite las ejecuciones
Una generación puede ser excepcionalmente buena o mala. Repite finalistas dos o tres veces y guarda archivos con nombres claros.
Haz revisión ciega si es posible
Oculta las etiquetas de modelo en la primera escucha y escribe notas antes de revelar el origen.
Separa dimensiones
Identidad, inteligibilidad, pronunciación, prosodia, estabilidad, artefactos y ajuste a la tarea son criterios distintos.
No llames MOS a cualquier escala 1–5
Una puntuación interna puede ser útil, pero Mean Opinion Score implica una metodología de escucha definida y agregación de oyentes. Si no hiciste ese estudio, llámalo revisión interna o preferencia.
No inventes benchmarks de latencia
Cola, proveedor, red, longitud, cold starts y región afectan el tiempo. Publica latencia solo con protocolo y muestra documentados.
Separa evidencia upstream y medición propia
Distingue hechos del producto alojado, resultados publicados por autores del modelo y mediciones realizadas realmente por tu servicio.
Registra la fecha
Modelos e infraestructura cambian. Guarda model ID, referencia, texto, idioma, controles, runs y método.
Prueba la tarea real
Audiolibros deben usar párrafos reales; localización española debe usar español real.
Acepta resultados inconclusos
Si A y B se alternan o son equivalentes, registra “sin ventaja audible consistente en esta prueba” y decide por idiomas, controles, coste o simplicidad.
La credibilidad de un A/B viene de cambiar una variable, repetir, documentar y no afirmar más de lo que el experimento demuestra.