¿Qué está pasando con la VUI (Interfaz de Voz)?

Si hay un ámbito en el que la hegemonía de Google esté en entredicho, ese es el campo de la Voice User Interface (Interfaz de Usuario de Voz). Aunque Google Assistant estaba fuerte en el mercado junto con Alexa de Amazon, la irrupción de la inteligencia artificial y las herramientas de procesamiento natural del lenguaje, con la alianza Microsoft-OpenAI y ChatGPT, han dado un vuelco a la carrera por la VUI.

Google podría perder muchos enteros en su hegemonía, casi monopolística, en el sector de las búsquedas si pierde la carrera por una interfaz por voz dirigida por inteligencia artificial.

Microsoft frente a Google, Amazon y Apple

Amazon fue uno de los primeros en llegar al mercado de la interfaz por voz con su asistente virtual Alexa. Alexa se ha convertido en un nombre familiar y ha encontrado su camino en millones de hogares a través de dispositivos como los altavoces de la gama Echo. Amazon ha trabajado constantemente en la mejora de su asistente, tanto en términos de comprensión del lenguaje natural como en la integración con otros dispositivos y servicios. Una de sus estrategias clave ha sido abrir su plataforma a desarrolladores externos a través de la creación de "Skills", lo que permite a terceros crear aplicaciones y servicios que aprovechen la tecnología de voz.

Google, por su parte, ha estado compitiendo con su Asistente de Google, que se encuentra disponible en una amplia gama de dispositivos, incluidos teléfonos inteligentes Android y altavoces inteligentes Google Home. La fortaleza de Google en el procesamiento de lenguaje natural y su acceso a una inmensa cantidad de datos de búsqueda lo han convertido en un gran competidor, mejorando constantemente la comprensión contextual y la capacidad de conversación para responder preguntas y brindar información relevante en tiempo real.

Microsoft también ha estado involucrado en la competencia por la interfaz por voz con su asistente virtual Cortana, aunque este no alcanzó la misma prominencia que Alexa y Google Assistant en los dispositivos de consumo masivo. Sin embargo, un movimiento importante que ha realizado Microsoft es su asociación estratégica con OpenAI para desarrollar conjuntamente tecnologías avanzadas de inteligencia artificial generativa, llevando el procesamiento de lenguaje natural a nuevos niveles.

Apple presentó su asistente de voz Siri con el lanzamiento del iPhone 4S. Siri se convirtió en uno de los primeros asistentes virtuales más populares en dispositivos móviles. En la actualidad, la firma de Cupertino ha integrado a Siri en la totalidad de su ecosistema de hardware, desde teléfonos y tabletas hasta ordenadores y altavoces inteligentes.

La interfaz por voz tiene un potencial inmenso en una amplia gama de aplicaciones, desde el hogar inteligente y la atención médica hasta la productividad en el lugar de trabajo, los sistemas integrados de automóviles o los chatbots de atención al cliente automatizada. La compañía que logre desarrollar la tecnología de voz más avanzada y fluida tendrá una ventaja competitiva significativa en este mercado en continuo crecimiento.

Los asistentes por voz y los modelos de procesamiento del lenguaje actuales

Para comprender el momento actual, conviene echar una mirada atrás a la evolución histórica de estos sistemas de procesamiento del lenguaje natural y la inteligencia artificial:

  1. Décadas de 1950 y 1960: Surgen los primeros experimentos científicos en reconocimiento de voz. En esta etapa inicial, los sistemas informáticos eran muy limitados en términos de vocabulario, precisión y eficiencia de cómputo.
  2. Años 70: Se desarrollaron los primeros sistemas comerciales de reconocimiento de voz, que se limitaban a aplicaciones muy especializadas de nicho, tales como la transcripción de dictados médicos.
  3. Década de 1980: Se produce un aumento significativo en la investigación académica en el procesamiento del lenguaje natural (PLN) y el reconocimiento de patrones de voz de forma digital.
  4. Años 90: Se ven los primeros intentos reales de incorporar VUI en productos de consumo masivo, como los sistemas de marcación por voz en teléfonos móviles primitivos y programas de dictado para ordenadores personales.
  5. Años 2000: Surgen los asistentes virtuales precursores como Siri en sus fases tempranas o Google Voice Search, los cuales permiten a los usuarios realizar búsquedas en línea básicas mediante comandos de voz.
  6. Década de 2010 en adelante: Eclosión de los asistentes virtuales integrados en altavoces inteligentes domésticos (Alexa de Amazon, Google Assistant, entre otros).

Actualmente, los modelos de procesamiento del lenguaje natural (PLN) basados en redes de aprendizaje profundo son la auténtica columna vertebral de estos asistentes de voz. Estos modelos permiten que los dispositivos comprendan el lenguaje humano, asimilen el contexto semántico y generen respuestas inteligentes de forma automatizada, destacando el uso de modelos GPT masivos entrenados en conjuntos de datos globales.

Los asistentes de voz modernos utilizan estos complejos modelos para interpretar el habla de los usuarios de forma fluida. Por ejemplo, al solicitar información meteorológica o de tráfico, el asistente procesa el audio, extrae la intención del usuario mediante PLN, consulta las bases de datos externas correspondientes y devuelve la información de forma oral.

La interfaz por voz de ChatGPT

OpenAI ha transformado la manera de interactuar con sus modelos de inteligencia artificial mediante el lanzamiento de su interfaz de voz avanzada. De esta forma, los usuarios pueden mantener una conversación fluida con el chatbot con respuestas conversacionales en tiempo real, interactuando de la misma manera que en una llamada telefónica convencional.

Esta capacidad de comunicación hablada se fundamenta en la combinación de modelos especializados. Por un lado, Whisper, el modelo de voz a texto de OpenAI (se abre en una nueva pestaña), se encarga de transcribir el audio del usuario a texto binario legible por el modelo generativo. Por el otro, un nuevo motor de síntesis de texto a voz (Text-to-Speech) se encarga de convertir la respuesta de texto del chatbot en palabras orales de forma natural.

El futuro de los dispositivos orientados a la VUI

El futuro de las tecnologías centradas en la VUI avanza a un ritmo vertiginoso. Un ejemplo claro es cómo los comandos de voz están transformando la forma en que interactuamos con nuestros vehículos mediante sistemas de infoentretenimiento inteligentes. Los conductores pueden ajustar parámetros de climatización, gestionar llamadas o interactuar con el GPS de una manera mucho más segura sin apartar las manos del volante.

En el ámbito corporativo, la influencia de los asistentes de voz se refleja en el perfeccionamiento continuo de los canales de telefonía VoIP y atención automatizada. Estos sistemas brindan una resolución de incidencias sumamente eficiente, optimizando los recursos de soporte técnico de las organizaciones.

Asimismo, la integración de avatares virtuales que interactúan por voz en sitios web y aplicaciones móviles ofrece una experiencia de atención al cliente personalizada y atractiva, apoyándose en modelos LLM para resolver consultas contextuales complejas de manera natural.

Capacidad de interacción y repercusión social

La consolidación de los sistemas conversacionales por voz proyecta un impacto transformador en diversas áreas con una alta relevancia social:

  • Ámbito educativo: Los asistentes de voz actúan como tutores personalizados interactivos, ayudando a los estudiantes a buscar documentación, resolver dudas conceptuales y entrenar habilidades lingüísticas de forma adaptativa.
  • Accesibilidad universal: La interacción por voz desempeña un papel crucial en la eliminación de barreras digitales para personas con discapacidades visuales o de movilidad, aportando una mayor independencia y autonomía en el uso de la tecnología cotidiana.
  • Entornos sanitarios y atención médica: Facilita la monitorización de pacientes crónicos en el hogar mediante dispositivos IoT conectados por voz, permitiendo registrar signos vitales, emitir recordatorios de medicación y automatizar la gestión de citas médicas de forma ágil.

Hacia una personalización inteligente

Las interfaces de voz actuales continúan evolucionando para superar las limitaciones de los comandos planos tradicionales. Con la adopción de modelos de lenguaje basados en arquitecturas de última generación, los sistemas no solo procesan palabras sueltas, sino que interpretan tonos, dobles sentidos y preferencias históricas del usuario, adaptando la experiencia de forma predictiva y personalizada.

En Gigas, como grupo especializado en la prestación de servicios convergentes e integrales de comunicaciones y cloud para empresas, disponemos de una infraestructura perimetral avanzada distribuida en nuestros centros de datos certificados en Europa y Latinoamérica. Nuestras plataformas garantizan la baja latencia, disponibilidad y resiliencia necesarias para alojar las aplicaciones de datos críticas del tejido corporativo actual.