Asistente de voz con avatar y kiosco

El canal de voz permite hablar con el asistente en lugar de escribir, con avatar 2D o 3D, detección de presencia en kiosco y soporte de múltiples idiomas.

El canal de voz convierte el mismo asistente de texto en un interlocutor hablado. El visitante habla, el asistente escucha, procesa la pregunta con el mismo cerebro y las mismas reglas de control que el chat de texto, y responde con voz mientras un avatar gestualiza. Es el mismo conocimiento, la misma fiabilidad, una experiencia completamente diferente.

Cómo funciona la conversación por voz

El bucle de voz sigue estos pasos de forma automática:

  1. El sistema detecta que el visitante ha terminado de hablar.
  2. Transcribe la pregunta a texto.
  3. Envía la pregunta al mismo orquestador del chat de texto: las respuestas guiadas, el conocimiento del cerebro, los términos controlados y la cita obligatoria funcionan exactamente igual.
  4. Convierte la respuesta a voz.
  5. El avatar gestualiza mientras habla. Las fuentes citadas y las acciones asociadas (fichas, formularios, enlaces) se muestran como texto en la pantalla junto al avatar.

El visitante puede interrumpir al asistente mientras habla para reformular la pregunta o hacer una consulta diferente.

El avatar

El avatar es la representación visual del asistente mientras habla. Está disponible en dos modalidades:

  • Avatar 2D (por defecto): icono o ilustración animada que cambia de estado según la fase de la conversación: esperando, escuchando, pensando, hablando. La boca se mueve en sincronía con la amplitud del audio. Funciona en cualquier dispositivo, incluidos teléfonos de gama baja.
  • Avatar 3D (próximamente): modelo tridimensional con lip-sync preciso y gestos. Cada clon puede tener su propio avatar con la voz y los rasgos visuales que defina la organización.

Si el visitante tiene problemas con el micrófono, con el audio o simplemente prefiere escribir, puede cambiar a la interfaz de texto en cualquier momento sin perder la conversación.

Modo kiosco

El modo kiosco está diseñado para pantallas táctiles de atención presencial en espacios físicos: recepción de oficinas, ventanillas de organismos públicos, puntos de información en centros comerciales o museos.

En modo kiosco:

  • La interfaz ocupa toda la pantalla con el avatar y los subtítulos en tamaño grande.
  • El micrófono se activa automáticamente cuando el sistema detecta la presencia de una persona frente a la pantalla.
  • Al alejarse el visitante, el asistente vuelve a la pantalla de espera y está listo para el siguiente.
  • Una pequeña ventana en la esquina muestra la imagen de la cámara para ayudar al visitante a posicionarse.

Idiomas y transcripción

El canal de voz puede configurarse por versión para operar en el idioma o idiomas que necesites. La transcripción de voz a texto y la síntesis de texto a voz son intercambiables según el perfil de la organización:

  • Organizaciones en la nube: pueden usar servicios de transcripción en la nube para mayor velocidad.
  • Entidades on-premise: el audio nunca sale de la red de la organización. La transcripción y la síntesis de voz se procesan localmente, cumpliendo con los requisitos de soberanía de datos.

Accesibilidad

El canal de voz está diseñado como una alternativa al chat de texto, no como un sustituto. Los subtítulos siempre están visibles mientras el asistente habla. El visitante puede en cualquier momento pasar a escribir si lo prefiere o si el entorno tiene ruido excesivo.

Configuración en el panel de administración

Para habilitar el canal de voz en una versión, ve a la configuración de la versión y selecciona el canal Kiosco. Desde ahí puedes:

  • Elegir el idioma principal y los idiomas adicionales.
  • Activar el modo manos libres (el micrófono se abre automáticamente tras cada respuesta).
  • Configurar la detección de presencia para la pantalla de espera automática.
  • Seleccionar la voz del asistente entre las disponibles para el idioma configurado.