Open WebUI publicó la versión 0.12.0 que introduce llamadas de voz en tiempo real y la posibilidad de mostrar avatares 3D animados durante esas llamadas. La novedad permite que una capa de voz realtime maneje la charla ligera y delegue las preguntas relevantes al modelo de chat seleccionado, integrando la respuesta hablada con el historial y las herramientas del chat.
Qué cambia: llamadas Realtime y flujo híbrido voz–chat
Con el nuevo modo Realtime en la sección Voice calls de Audio settings, las llamadas de voz pueden usar un modelo de voz en tiempo real (por ejemplo, gpt-realtime-2.1-mini con la voz Marin por defecto). Ese modelo actúa como intermediario: se encarga de la pequeña charla y, cuando detecta una pregunta o tarea seria, la reenvía al modelo de chat seleccionado que dispone del contexto y las herramientas. La respuesta final se genera en el chat y, al mismo tiempo, la capa Realtime pronuncia la respuesta para mantener la experiencia conversacional hablada.
A quién afecta y permisos
La función está pensada para administradores de instancias y operadores de bots que quieran ofrecer interacción por voz en tiempo real. Las llamadas requieren el permiso Allow Call para los usuarios que las inicien y tienen una duración máxima de una hora. Además, aunque la capa Realtime puede manejar aprobaciones simples y charla, las respuestas a aprobaciones o preguntas generadas por herramientas integradas siguen debiéndose atender en el chat escrito.
Configuración y variables de entorno
Open WebUI expone varias variables de entorno para activar y personalizar Realtime:
- AUDIO_REALTIME_ENABLED: habilita el soporte Realtime.
- AUDIO_REALTIME_OPENAI_API_BASE_URL y AUDIO_REALTIME_OPENAI_API_KEY: para apuntar a la API Realtime y autenticar las solicitudes.
- AUDIO_REALTIME_MODEL y AUDIO_REALTIME_VOICE: permiten elegir el modelo Realtime y la voz a usar.
- AUDIO_REALTIME_TRANSCRIPTION_MODEL: modelo para transcripción si procede.
- REALTIME_CALL_PROMPT_TEMPLATE: plantilla que guía el comportamiento del modelo Realtime en llamadas.
Los modelos también pueden fijar su propia voz Realtime desde el editor de modelos de la aplicación.
Avatares 3D animados en llamadas
Otra novedad es la posibilidad de mostrar un avatar 3D animado en lugar de la esfera de voz durante llamadas Realtime. En el editor de modelos se puede subir un avatar VRM riggeado de hasta 25 MiB y previsualizarlo. Opcionalmente se pueden añadir clips VRMA de hasta 10 MiB para los estados idle, listening y speaking, y hasta 16 gestos nombrados con su descripción.
El modelo de voz reproduce automáticamente esos gestos cuando la conversación lo sugiere o si se le solicita —por ejemplo, saludar con la mano o aplaudir— y la boca del avatar se sincroniza con la respuesta hablada.
Implicaciones prácticas y pasos para administradores
Para quienes administran instancias de Open WebUI, los pasos prácticos son:
- Revisar y activar AUDIO_REALTIME_ENABLED si desean ofrecer llamadas Realtime.
- Configurar las variables de entorno necesarias para conectar con la API Realtime y seleccionar el modelo/voz apropiados.
- Asignar el permiso Allow Call a los roles que deban iniciar llamadas y controlar la duración máxima permitida.
- Si usan avatares, preparar archivos VRM y VRMA respetando los límites de tamaño y probar la previsualización en el editor de modelos.
La actualización amplía las opciones de interacción en Open WebUI, combinando procesamiento de voz en tiempo real con la potencia de los modelos de chat para mantener contexto y herramientas del flujo escrito. Los administradores deben planificar autenticación y permisos antes de habilitar la funcionalidad en producción.
Lee también:
- WordPress prueba un enfoque ‘server-aware’ para colaboración en tiempo real
- Woodpecker CI 3.19 corrige fuga de variables en matrices y añade etiquetas de agente impuestas por servidor
Fuente: Release notes from open-webui




