Agentes de voz: latencia baja y más idiomas en 2026

Agentes de voz: latencia baja y más idiomas en 2026

Qué ha pasado en los últimos meses

OpenAI presentó GPT‑Live‑1 para desarrolladores con mejoras en “turn‑taking” y comportamiento interactivo frente a su versión Realtime anterior, además de liderar pruebas de tareas de agente de voz end‑to‑end; la compañía también explicó cómo rediseñó su pila WebRTC para bajar la latencia en producción y escalar audio bidireccional en tiempo real (OpenAI, OpenAI). (openai.com)
Google ha ido trasladando capacidades de Project Astra a Gemini Live y a su Live API para desarrolladores, con audio en tiempo real, entrada de vídeo en streaming y uso combinado de herramientas; además documenta traducción voz‑a‑voz de baja latencia en más de 70 idiomas (DeepMind/Google, Google, Docs). (deepmind.google)
Apple anunció “Siri AI” en la WWDC de junio de 2026, pero retrasó su lanzamiento en la UE citando la DMA; Bruselas replicó que la decisión era de Apple, y en España iOS 27 llegó sin Siri AI en iPhone, con señales de pruebas limitadas en betas posteriores (Apple Newsroom, AP News, Cinco Días, Cinco Días). (apple.com)

Calidad de voz y latencia: hacia conversaciones naturales

En generación de voz, ElevenLabs elevó la barra con su modelo Eleven v4 Turbo, que declara síntesis en torno a 100 ms y soporte de decenas de idiomas europeos, incluido español y catalán, útil para marcas locales con identidad vocal propia (ElevenLabs Docs). (elevenlabs.io)
En reconocimiento y “turn‑taking”, la documentación de OpenAI y su comunidad reportan descensos relevantes de latencia en los modelos Realtime recientes y en GPT‑Live‑1, con mejoras de “full‑duplex” y coordinación entre razonamiento y habla (OpenAI, Foro dev). (openai.com)
Para quienes necesiten despliegues controlados o en el borde, NVIDIA documenta ASR “streaming” con tamaños de bloque mínimos de 80 ms y resultados intermedios, lo que ayuda a arrancar respuestas antes de que el usuario termine la frase (NVIDIA, NVIDIA). (perspectives.nvidia.com)

Idiomas y multilingüismo: menos fricción en llamadas y mostradores

Google detalla en su Live API la traducción voz‑a‑voz de baja latencia con soporte amplio de idiomas, pensada para agentes que cambian de herramienta durante la conversación (útil en recepción o reservas) (Docs). (ai.google.dev)
En el ecosistema Microsoft, Foundry describe “GPT Realtime Translate” y novedades en Azure AI Speech: transcripción multilingüe en una sola sesión, refinado posterior y menor latencia (hasta 3× frente a la versión anterior), relevantes para atención telefónica y reuniones híbridas (Microsoft Learn, TechCommunity, Foundry Blog). (learn.microsoft.com)

¿Las pymes se están subiendo al carro?

Las cifras públicas muestran avance, con matices. El ONTSI reporta que la adopción de IA en pymes españolas subió del 8,6% al 10,4% con datos de 2024, y Eurostat sitúa a España en torno al 20% de empresas usando al menos una tecnología de IA en 2025; el crecimiento es real, pero desigual por tamaño y sector (ONTSI, Eurostat). (ontsi.es)
A corto plazo, el retraso de Siri AI en la UE limita su impacto directo en negocios europeos, mientras que las opciones basadas en API (OpenAI, Google, Microsoft) y despliegues controlados (NVIDIA) están disponibles hoy para casos reales de recepción, reservas y posventa (Apple Newsroom, OpenAI, Docs Google, NVIDIA Riva). (apple.com)

Qué significa para tu negocio

En Veltim ya integramos estas capacidades en nuestros agentes de voz para clínicas, restaurantes y negocios locales: recepción 24/7, recordatorios automáticos y gestión de citas o reservas, siempre con métricas de tiempo de respuesta y satisfacción, y sin promesas infladas: el impacto depende de tu flujo, tu base de clientes y cómo midas cada paso con datos.

¿Quieres saber cómo aplicarlo en tu negocio? Cuéntanos tu caso.

Kevin Rojas — Fundador de Veltim. Programador e ingeniero de IA: agentes de voz, chatbots de WhatsApp e integraciones con CRM para negocios reales. LinkedIn · YouTube · Sobre Veltim

Contacto: veltim.com · Teléfono: +34 623 05 08 56 · Madrid, España.