Metodologia de calidad de voz: latencia percibida, MOS y tasa de alucinacion en agentes de voz conversacionales
Los agentes de voz basados en modelos de lenguaje de gran escala (LLM) enfrentan tres dimensiones criticas de calidad que determinan la experiencia del usuario: latencia de primer token, puntuacion de opinion media (MOS) y tasa de alucinacion. En este trabajo presentamos una metodologia de medicion sistematica para las tres dimensiones, describimos las metricas y umbrales que hemos adoptado internamente, y discutimos las implicaciones para el diseno de sistemas de agentes en produccion.