Cuando conversas con un asistente de inteligencia artificial, lo que lees en pantalla es solo una parte del proceso. Detrás hay un razonamiento interno que las empresas de IA guardan con celo, porque revela cómo llega el modelo a sus conclusiones. OpenAI ha confirmado que alguien intentó apropiarse de ese razonamiento a gran escala, y que logró frenarlo tras meses de vigilancia.
El asunto cobra relevancia ahora porque OpenAI publicó el pasado 30 de septiembre de 2026 un comunicado detallado sobre lo ocurrido, en el que sitúa el origen del problema en la primera semana de julio de ese año. La compañía habla de una operación coordinada que involucró a más de 15.000 usuarios y que atribuye, en su núcleo, a personas vinculadas con Moonshot AI, la empresa china detrás del modelo Kimi.
Qué buscaban los responsables de la campaña
OpenAI describe lo sucedido como un caso de destilación adversaria. El término se refiere al uso sistemático y no autorizado de las respuestas o del razonamiento de un modelo ajeno para entrenar, reproducir o mejorar otro sistema de inteligencia artificial.
El objetivo concreto era el razonamiento protegido, es decir, el registro interno que el modelo genera mientras procesa una tarea antes de dar una respuesta final. Según la compañía, ese contenido puede incluir información que nunca llega a mostrarse al usuario, y que resultaría valiosa para quien quisiera replicar las capacidades del modelo sin partir de cero.
OpenAI insiste en un matiz importante: no hubo una intrusión en el sentido clásico. Los operadores no rompieron el cifrado de la compañía, no accedieron a ninguna base de datos ni consiguieron entrar directamente en conversaciones almacenadas de otros usuarios.
Cronología: de julio a los picos del día 24 y 25
Según el relato de OpenAI, la actividad arrancó el 1 de julio con un volumen bajo, casi indetectable. La situación cambió drásticamente los días 24 y 25 de julio, cuando se registraron 16.000 solicitudes con un patrón de extracción claramente identificable, procedentes de más de 4.000 usuarios distintos.
La investigación posterior amplió el foco y detectó actividad de prompts relacionada en un grupo mucho mayor, de más de 15.000 usuarios. OpenAI sostiene que logró interrumpir por completo la operación el 28 de julio.
La compañía matiza que estas cifras reflejan intentos de extracción, no necesariamente casos en los que la extracción se consumó con éxito. También reconoce que el patrón de ataque fue cambiando con el tiempo, lo que, según su propio análisis, obliga a mantener defensas por capas que se adapten constantemente a nuevas técnicas.
El método: cifrar, trasladar y pedir que se descifre en otra conversación
La técnica descrita por OpenAI resulta llamativa por su sencillez aparente. Los operadores copiaban fragmentos de razonamiento cifrado generados en una conversación y los trasladaban a otra conversación distinta, donde pedían al modelo que los descifrara y los transcribiera.
De este modo conseguían que un contenido pensado para permanecer oculto se reprodujera en un formato legible para quien lo solicitaba. La operación se repitió de forma coordinada y a gran escala, en lo que OpenAI califica como un incumplimiento directo de sus términos de servicio.
La compañía añade un dato relevante: investigadores de seguridad independientes le habían comunicado previamente, a través de canales de divulgación responsable, vulnerabilidades relacionadas con el intercambio de información entre modelos y con procesos de compactación de conversaciones. OpenAI confirmó que esas vías de ataque eran reales y reconoce que ese trabajo externo le ayudó a comprender mejor el tipo de amenaza y a acelerar sus medidas de mitigación.
La atribución a Moonshot AI: certezas y zonas sin aclarar
OpenAI se muestra cauta a la hora de fijar responsabilidades. La propia compañía reconoce que no tiene certeza absoluta de si todos los usuarios implicados actuaban bajo la coordinación de un único actor.
Pese a esa cautela, el comunicado sí señala que un grupo central de la actividad está asociado a personas vinculadas con Moonshot AI, la empresa responsable del modelo Kimi. OpenAI no detalla públicamente qué pruebas o indicios concretos la llevaron a esa conclusión.
La compañía subraya además que este tipo de manipulación no es exclusivo de sus propios modelos. Por ese motivo, decidió compartir la información recabada con otras empresas del sector a través del Frontier Model Forum, una plataforma de colaboración entre grandes desarrolladores de inteligencia artificial.
Por qué OpenAI habla de seguridad nacional
El argumento central de OpenAI es que el razonamiento extraído podría usarse para entrenar un modelo distinto sin mantener las salvaguardas que la compañía aplica a las respuestas visibles del original.
A gran escala, sostiene OpenAI, este tipo de destilación también podría acelerar la transferencia de capacidades avanzadas de inteligencia artificial sin que el receptor tenga que asumir la misma inversión en seguridad que exige desarrollar un modelo desde cero. La empresa señala que esta preocupación aumenta a medida que los modelos de IA ganan capacidades en terrenos de doble uso, es decir, aplicables tanto a fines civiles como potencialmente sensibles.
Conviene tener presente que esta valoración procede de la propia empresa afectada, que además compite directamente en el mercado con los actores a los que señala.
La respuesta de OpenAI: cuentas bloqueadas y nuevas barreras técnicas
OpenAI combinó varias líneas de actuación. En el plano de las cuentas, bloqueó o restringió el acceso a perfiles considerados fraudulentos, reforzó los controles aplicados en el registro de nuevos usuarios y amplió la vigilancia sobre redes de cuentas relacionadas entre sí.
En el plano técnico, la compañía cerró una vía concreta que permitía a alguien que ya tuviera en su poder el razonamiento cifrado de otro usuario reproducirlo y recuperar su contenido. También introdujo comprobaciones adicionales para detectar y bloquear salidas en formato streaming que pudieran dejar al descubierto fragmentos de razonamiento protegido.
Cuando la actividad sospechosa se canalizaba a través de servicios de terceros, OpenAI trabajó junto a esos proveedores para identificar y desactivar las cuentas implicadas. Finalmente, compartió sus hallazgos tanto con el Frontier Model Forum como con canales gubernamentales de intercambio de información sobre seguridad.
Qué debería revisar quien usa o integra modelos de OpenAI
Del propio comunicado de la compañía se extraen varias recomendaciones prácticas para quienes desarrollan productos sobre sus modelos.
La primera es comprobar si el sistema propio almacena o reenvía artefactos de razonamiento de forma portable o reproducible, algo que OpenAI identifica como un riesgo potencial.
La segunda afecta a quienes despliegan modelos a través de un socio en la nube: conviene verificar que ese despliegue cuenta con las mismas protecciones que el servicio directo, ya que la propia compañía admite que estos entornos alojados por terceros necesitan salvaguardas equivalentes.
La tercera recomendación se dirige a aplicaciones que encadenan distintas herramientas de IA: OpenAI advierte de que los ataques que aprovechan la salida de esas herramientas requieren protecciones capaces de examinar algo más que el texto visible al usuario final.
Por último, la compañía aconseja vigilar patrones de uso anómalos, puesto que la campaña detectada se apoyó precisamente en cuentas fraudulentas y en volúmenes de solicitudes fuera de lo habitual.
Qué puede esperar el usuario a partir de ahora
El comunicado deja claro que la investigación no se ha cerrado. OpenAI continúa analizando y mitigando este tipo de ataques, y anticipa que los intentos de destilación adversaria serán cada vez más sofisticados a medida que los propios modelos de inteligencia artificial mejoren.
Para quien utiliza estos sistemas, ya sea como usuario particular o como desarrollador a través de la API, la consecuencia práctica apunta a más controles en el registro de cuentas, mayor vigilancia sobre patrones de uso inusuales y posibles restricciones adicionales en la forma en que se gestionan los datos de razonamiento. Quienes mantengan integraciones activas con los modelos de OpenAI harían bien en revisar sus configuraciones y los términos de servicio vigentes.
Samuel Gil es especialista en infraestructura tecnológica, administración de servidores y desarrollo de servicios digitales. Con una sólida trayectoria en entornos web de alta exigencia, optimización de servidores y gestión de arquitecturas de red, Samuel dedica su labor en faq-box.com a desglosar cuestiones técnicas complejas para convertirlas en guías prácticas, transparentes y de alto valor técnico.
Su enfoque editorial prioriza el rigor, la seguridad en los sistemas y la resolución eficiente de problemas técnicos cotidianos y avanzados. A través de sus análisis, busca ofrecer respuestas directas y contrastadas para profesionales y entusiastas del sector tecnológico.
Cuenta con una sólida formación en el área tecnológica, destacando su especialización a través del Máster en Inteligencia Artificial Aplicada a la Gestión Empresarial y el MBA in Digital Transformation & Artificial Intelligence de ISEEN.EU, lo que aporta un rigor técnico avanzado a cada análisis de desarrollo y arquitectura digital.

