calidad de vozMOSlatenciaalucinacionesevaluacion

Metodologia de calidad de voz: latencia percibida, MOS y tasa de alucinacion en agentes de voz conversacionales

12 min de lectura
Vocanta Research

Resumen

Los agentes de voz basados en modelos de lenguaje de gran escala (LLM) enfrentan tres dimensiones criticas de calidad que determinan la experiencia del usuario: latencia de primer token, puntuacion de opinion media (MOS) y tasa de alucinacion. En este trabajo presentamos una metodologia de medicion sistematica para las tres dimensiones, describimos las metricas y umbrales que hemos adoptado internamente, y discutimos las implicaciones para el diseno de sistemas de agentes en produccion.

Contexto y motivacion

A medida que los agentes de voz con IA escalan desde entornos de laboratorio hacia produccion real, la comunidad ha identificado tres vectores de falla recurrentes: latencia inaceptable que rompe la ilusion de conversacion natural, calidad de sintesis de voz que genera friccion auditiva, y alucinaciones que producen informacion incorrecta durante llamadas en vivo. Cada uno de estos vectores tiene metricas bien establecidas en la literatura, pero rara vez se miden de manera integrada en un mismo sistema. Nuestra metodologia busca cerrar esa brecha.

Latencia percibida: de "primer token" a "primer sonido"

La latencia de primer token (TTFT, time-to-first-token) es una metrica comun en benchmarks de LLM, pero en voz lo que importa es el tiempo hasta que el usuario escucha el primer fragmento de audio sintetizado. Denominamos a esta metrica TTFS (time-to-first-sound). En nuestros experimentos, un TTFS mayor a 1.2 segundos produce una caida perceptible en la satisfaccion del usuario medida post-llamada. El pipeline tipico introduce latencia en cuatro etapas: reconocimiento automatico de voz (ASR), procesamiento por el LLM (incluyendo TTFT), sintesis de texto a voz (TTS) y transmision de audio. La optimizacion requiere abordar cada etapa de forma independiente y minimizar la cola entre ellas mediante streaming bidireccional.

MOS y calidad auditiva subjetiva

La puntuacion de opinion media (Mean Opinion Score, MOS) es un indicador de 1 a 5 que captura la calidad subjetiva percibida de una voz sintetizada. Una MOS de 4.0 o superior es el umbral generalmente aceptado para experiencias de voz "naturales". Los modelos modernos de TTS basados en redes neuronales pueden alcanzar MOS promedio de 4.2 a 4.6 en textos genericos, pero el desempeno degrada en nombres propios, terminologia tecnica o medica, y cambios de idioma dentro de un mismo turno. Recomendamos evaluar la MOS no solo en corpus genericos sino en muestras representativas del dominio especifico (por ejemplo, vocabulario de salud dental para verticales clinicas).

Tasa de alucinacion: definicion y medicion

Definimos "alucinacion" en el contexto de agentes de voz como cualquier aserto del agente que sea factualmente incorrecto respecto al contexto de negocio configurado, incluyendo horarios, servicios, precios y protocolos. La medicion requiere un conjunto de evaluacion anotado por humanos que cubra tanto prompts directos como escenarios adversariales donde el usuario presiona al agente a confirmar informacion falsa. En nuestros experimentos con sistemas guardrail desactivados, las tasas de alucinacion tipicas oscilan entre el 3% y el 8% en dominios especializados. Con guardrails activos (validacion post-generacion contra una base de conocimiento estructurada), la tasa cae por debajo del 0.5% en los mismos benchmarks. La reduccion no es gratuita: introduce latencia adicional de aproximadamente 150 a 300 ms por turno, lo que requiere optimizacion cuidadosa del pipeline.

Integracion de las tres dimensiones: un marco unificado

Proponemos evaluar los agentes de voz en un espacio tridimensional (latencia, MOS, tasa de alucinacion) con umbrales minimos no negociables: TTFS menor a 1.2 s, MOS mayor o igual a 4.0, y tasa de alucinacion menor al 1%. Un agente que supera los tres umbrales se considera "produccion-ready" desde la perspectiva de calidad de voz. Los que fallen en cualquier dimension requieren iteracion antes de despliegue a usuarios reales. Este marco tambien sirve como base para un sistema de monitoreo continuo en produccion: las mismas metricas que se miden offline deben observarse online mediante instrumentacion de cada llamada.

Limitaciones y trabajo futuro

La metodologia presentada asume un dominio de negocio bien definido con una base de conocimiento estructurada. En dominios abiertos, la definicion de alucinacion se vuelve mas ambigua. Ademas, la MOS subjetiva varia segun cultura y edad del oyente; trabajos futuros exploraran coeficientes de ajuste demografico. Finalmente, la latencia objetivo de 1.2 s es conservadora para conversaciones en tiempo real; con infraestructura de edge computing podrian lograrse objetivos de 0.8 s o menores.