Ciberseguridad

OpenAI dice haber frenado una campaña para extraer el razonamiento de sus modelos vinculada a personas relacionadas con Moonshot AI

OpenAI asegura haber desarticulado una campaña para extraer el razonamiento protegido de sus modelos, con un núcleo vinculado a personas relacionadas con Moonshot AI.

OpenAI asegura haber identificado y desarticulado una campaña coordinada que intentaba extraer el razonamiento protegido de sus modelos de inteligencia artificial. La compañía sitúa las primeras actividades a comienzos de julio y afirma que el núcleo de una parte de la operación estaba vinculado a personas relacionadas con Moonshot AI, la empresa desarrolladora del modelo Kimi.

OpenAI no afirma que todos los operadores pertenecieran a una única organización. La compañía señala que no está claro si todos los actores observados durante la campaña procedían del mismo grupo, aunque atribuye un núcleo de la actividad a individuos asociados con Moonshot AI.

Más de 16.000 intentos en solo dos días

La actividad comenzó el 1 de julio con un volumen reducido, según OpenAI. El 24 y 25 de julio se produjeron dos picos en los que la compañía detectó 16.000 solicitudes que utilizaban un patrón relacionado con la extracción de razonamiento y procedían de más de 4.000 usuarios.

La investigación posterior identificó patrones relacionados en un grupo de más de 15.000 usuarios. OpenAI asegura que consiguió interrumpir por completo esa actividad el 28 de julio.

Hay una precisión importante sobre estas cifras: 16.000 no significa que se extrajeran 16.000 razonamientos con éxito. OpenAI indica expresamente que sus cifras representan intentos de extracción y no necesariamente extracciones exitosas.

No rompieron el cifrado ni accedieron a una base de datos

El incidente no consistió en romper el cifrado de OpenAI ni en entrar directamente en sus bases de datos.

OpenAI afirma que los operadores no rompieron su cifrado, no comprometieron una base de datos y no obtuvieron acceso directo a las conversaciones almacenadas de los usuarios.

En lugar de atacar directamente la infraestructura de almacenamiento, manipularon las interacciones con los modelos para intentar hacer visible el razonamiento que normalmente permanece protegido y oculto para el usuario.

Cómo intentaban extraer el razonamiento protegido

Uno de los métodos descritos por OpenAI consistía en copiar el razonamiento cifrado de una conversación y utilizarlo posteriormente en otra conversación, pidiendo a una instancia del modelo que descifrara y transcribiera su contenido.

El objetivo era conseguir que información que normalmente no aparece en la respuesta visible pudiera reproducirse en una forma accesible para quien realizaba la solicitud.

OpenAI considera que este tipo de actividad encaja dentro de lo que denomina adversarial distillation, es decir, el uso sistemático y no autorizado de las salidas o del razonamiento de un modelo para ayudar a entrenar, reproducir o mejorar otro modelo.

Qué tiene que ver Moonshot AI

La atribución es uno de los puntos que OpenAI presenta con más cautela.

La compañía afirma que un núcleo de la actividad estaba relacionado con individuos asociados con Moonshot AI, la empresa china que desarrolla Kimi.

Sin embargo, OpenAI también indica que no puede determinar que todos los operadores observados durante el periodo analizado procedieran de un único actor.

Por tanto, la información publicada por OpenAI no equivale a afirmar que Moonshot AI como empresa haya robado los modelos de OpenAI. Tampoco demuestra por sí sola que un modelo concreto de Kimi haya sido entrenado con el material obtenido durante esta campaña.

El objetivo era obtener capacidades del modelo

OpenAI considera que el razonamiento protegido puede contener información que no aparece en la respuesta final y que puede ayudar a reproducir determinadas capacidades de un modelo.

La preocupación de la compañía es que la extracción a gran escala pueda utilizarse para desarrollar o mejorar otros modelos sin reproducir necesariamente las mismas inversiones en entrenamiento y mecanismos de seguridad.

OpenAI sostiene que este riesgo se vuelve especialmente relevante a medida que los modelos avanzados adquieren capacidades más sofisticadas en áreas de uso dual.

OpenAI cerró varias vías utilizadas en la campaña

La compañía afirma que respondió mediante una combinación de controles técnicos, restricciones de cuentas y cooperación con otros proveedores.

Entre las medidas anunciadas se encuentran el bloqueo o restricción de cuentas fraudulentas, controles adicionales durante el registro y la infraestructura, y una monitorización más amplia para detectar redes relacionadas.

OpenAI también reforzó las protecciones aplicadas al razonamiento oculto en diferentes usuarios, espacios de trabajo, organizaciones y familias de modelos.

También se cerró una vía de reproducción del razonamiento cifrado

Una de las medidas específicas consistió en cerrar una vía que permitía a alguien que ya tuviera el razonamiento cifrado de otro usuario reproducirlo y recuperar su contenido.

OpenAI afirma además que añadió controles capaces de detectar y retener determinadas salidas transmitidas que pudieran revelar razonamiento protegido.

Cuando la actividad relacionada pasó por servicios de terceros, la compañía trabajó con esos proveedores para identificar y bloquear las cuentas implicadas.

OpenAI compartió los hallazgos con otros laboratorios

La compañía afirma que el problema no es exclusivo de sus modelos.

OpenAI compartió información sobre las técnicas observadas mediante el Frontier Model Forum para que otros desarrolladores de modelos avanzados pudieran reforzar sus propias defensas.

También comunicó información a través de los canales apropiados de intercambio de información con organismos gubernamentales.

OpenAI sostiene que las técnicas utilizadas muestran que los sistemas que permiten transportar o reproducir artefactos de razonamiento pueden presentar riesgos similares.

El problema va más allá de un único modelo

La compañía considera que la extracción adversarial de capacidades es un problema de seguridad que puede afectar a diferentes modelos avanzados.

Los operadores no necesitan necesariamente acceder a los pesos de un modelo ni comprometer sus servidores para intentar reproducir parte de sus capacidades. La interacción repetida con un sistema puede convertirse en una vía para generar datos que posteriormente se utilicen en procesos de destilación.

Por ese motivo, OpenAI afirma que continuará reforzando los controles de extracción, la detección de campañas coordinadas y el intercambio de información sobre amenazas.

OpenAI espera campañas de extracción más sofisticadas

OpenAI advierte que este tipo de intentos puede hacerse más sofisticado a medida que mejoren los modelos frontier y aumente el interés por reproducir sus capacidades a menor coste.

La empresa afirma que seguirá trabajando en defensas para las salidas de herramientas, los clasificadores, los sistemas de rechazo y las implementaciones alojadas por socios externos.

El caso de Moonshot AI, por tanto, se presenta actualmente como una atribución realizada por OpenAI sobre un núcleo de la actividad, no como una prueba de que toda la operación proviniera de una única empresa ni como confirmación de que un modelo concreto haya incorporado con éxito el material supuestamente extraído.