Una videollamada de apenas un minuto bastó para que casi la mitad de los participantes en una prueba reciente no pudiera distinguir si hablaban con una persona o con una máquina. La responsable es Griffin, el nuevo modelo de inteligencia artificial desarrollado por la startup Tavus, que ha puesto en jaque la capacidad humana para detectar interlocutores artificiales en tiempo real.
El dato resulta especialmente relevante en un momento en que las videollamadas se han convertido en una herramienta cotidiana para el trabajo, la educación y las relaciones personales. Si una IA puede pasar por humana en ese contexto, las implicaciones alcanzan desde la atención al cliente hasta la seguridad digital.
Un salto que multiplica por veinte el engaño anterior
Según datos difundidos por Tavus, un 48% de los participantes en sus pruebas creyó estar conversando con una persona real durante una videollamada de un minuto con Griffin. La cifra contrasta de forma drástica con el rendimiento de los sistemas anteriores, que apenas lograban confundir a un 2,4% de los usuarios, de acuerdo con la información recogida por The Decoder.
Este salto no es casual. Tavus ha diseñado Griffin para procesar audio y vídeo de manera casi instantánea, permitiendo que la IA reaccione mientras el usuario todavía está hablando, en lugar de esperar a que termine su intervención, como ocurría con los modelos previos.
Cómo logra Griffin esa naturalidad
La clave técnica está en la velocidad de procesamiento. Según datos citados por Progressiverobot, el generador de vídeo de Tavus tarda una media de 0,43 segundos desde que recibe el audio hasta que el efecto correspondiente aparece en pantalla.
El sistema genera vídeo en fragmentos de 320 milisegundos y transmite el habla en paquetes de apenas 10 milisegundos, una granularidad que explica por qué la interacción resulta tan fluida. Griffin no solo escucha: también observa lo que el usuario comparte en pantalla y asiente durante la conversación, incorporando esa información visual a sus respuestas.
Una puntuación cercana a la humana en pruebas de NVIDIA
Tavus asegura que Griffin obtuvo una puntuación de 3,83 en una prueba de interacción audiovisual desarrollada por NVIDIA, un baremo utilizado para medir este tipo de rendimiento. El resultado se acerca al 3,92 que logran los participantes humanos en la misma prueba.
Esa puntuación supera con claridad el 2,80 obtenido por el siguiente mejor sistema publicado hasta ahora, según cifras recogidas por Doomers. La compañía ha presentado estos resultados como evidencia de que Griffin habría superado lo que denomina el «test de Turing en vídeo», una prueba orientada a comprobar si una máquina puede comportarse de forma indistinguible de un humano.
Con estos resultados, Tavus ha bautizado a Griffin como el primer «Modelo de Interacción Humana» (HIM, por sus siglas en inglés), una categoría que la propia empresa anunció en una publicación en la red social X.
Aplicaciones prometedoras y riesgos evidentes
Las posibilidades que abre una tecnología como Griffin son amplias. Entre los usos mencionados por The Decoder figura el soporte técnico basado en cámaras, donde un asistente podría ver el problema del usuario en tiempo real y responder con naturalidad.
También se perfilan aplicaciones como tutores virtuales para el estudio o compañeros digitales pensados para combatir la soledad, especialmente entre personas mayores.
Sin embargo, la misma capacidad que permite estas aplicaciones beneficiosas plantea riesgos considerables. Una herramienta capaz de engañar a casi la mitad de sus interlocutores podría facilitar estafas o campañas de desinformación difíciles de detectar, según advierten varios de los análisis recogidos sobre el lanzamiento.
Por qué no está disponible todavía
Por el momento, Griffin en su versión completa no está al alcance del público general. Tavus la mantiene como una «vista previa de investigación», limitada a un grupo reducido de probadores seleccionados.
Según indican Doomers y Ground, la empresa está trabajando en resolver las preocupaciones de seguridad antes de considerar un lanzamiento más amplio, conscientes del potencial de uso indebido de una tecnología tan convincente.
Qué significa este avance para los usuarios
La aparición de Griffin anticipa un escenario en el que las interacciones digitales —en el trabajo, en la atención al cliente o incluso en el ámbito personal— podrían volverse cada vez más difíciles de distinguir entre lo humano y lo artificial.
Esto no implica necesariamente un problema, ya que puede traducirse en servicios más eficientes y personalizados. Pero también exige un nivel mayor de atención por parte de los usuarios a la hora de verificar con quién —o con qué— están interactuando realmente en una videollamada.
Preguntas frecuentes
¿Qué es Griffin y quién lo desarrolló?
Griffin es un modelo de inteligencia artificial conversacional desarrollado por la startup Tavus, diseñado para mantener videollamadas con un nivel de naturalidad que la propia empresa describe como un «Modelo de Interacción Humana».
¿Cuántas personas creyeron que Griffin era humano?
En las pruebas realizadas, un 48% de los participantes creyó estar hablando con una persona real durante una videollamada de un minuto con Griffin, frente al 2,4% que lograban engañar los sistemas anteriores.
¿Cómo se midió el rendimiento de Griffin?
Tavus utilizó una prueba de interacción audiovisual de NVIDIA, en la que Griffin obtuvo 3,83 puntos, cerca del 3,92 que alcanzan los humanos y muy por encima del 2,80 del siguiente mejor sistema publicado.
¿Puedo usar Griffin actualmente?
No. La versión completa de Griffin funciona como una vista previa de investigación limitada a probadores seleccionados, mientras Tavus resuelve cuestiones de seguridad antes de un lanzamiento más amplio.
¿Qué riesgos plantea esta tecnología?
Al ser capaz de engañar a casi la mitad de los interlocutores en una videollamada, existe preocupación de que pueda utilizarse para estafas o para difundir desinformación de forma más creíble que con herramientas anteriores.
¿Para qué podría usarse Griffin en el futuro?
Entre los usos potenciales mencionados figuran el soporte técnico mediante cámara, tutores virtuales para estudiar y compañeros digitales orientados a combatir la soledad, especialmente en personas mayores.
Samuel Gil es especialista en infraestructura tecnológica, administración de servidores y desarrollo de servicios digitales. Con una sólida trayectoria en entornos web de alta exigencia, optimización de servidores y gestión de arquitecturas de red, Samuel dedica su labor en faq-box.com a desglosar cuestiones técnicas complejas para convertirlas en guías prácticas, transparentes y de alto valor técnico.
Su enfoque editorial prioriza el rigor, la seguridad en los sistemas y la resolución eficiente de problemas técnicos cotidianos y avanzados. A través de sus análisis, busca ofrecer respuestas directas y contrastadas para profesionales y entusiastas del sector tecnológico.
Cuenta con una sólida formación en el área tecnológica, destacando su especialización a través del Máster en Inteligencia Artificial Aplicada a la Gestión Empresarial y el MBA in Digital Transformation & Artificial Intelligence de ISEEN.EU, lo que aporta un rigor técnico avanzado a cada análisis de desarrollo y arquitectura digital.

