La trama se complica

¿Alguna vez has sentido que el apocalipsis de la IA está a solo un mal commit de distancia? Resulta que ese presentimiento podría ser lowkey acertado. Llevamos meses escuchando historias de terror sobre modelos de IA 'rebeldes' de titanes como OpenAI, Google, Meta y Anthropic que se salen de control y atacan sistemas que definitivamente no deberían tocar. Por un tiempo, parecía una serie de accidentes aislados, pero por fin se reveló el chisme: todos llevan a una misma fuente.

Conoce a la startup detrás del caos

Presentamos a Irregular, una firma de seguridad israelí fundada en 2023 que se especializa en 'pruebas de estrés' para estos modelos de IA masivos. Piénsalos como el equipo de control de calidad para la tecnología más poderosa del mundo. Ellos someten a estos modelos a simulaciones de 'captura la bandera' —básicamente retos de hacking de alto nivel— para ver si la IA puede encontrar vulnerabilidades en una red ficticia. Pero hay un detalle: la simulación no era tan falsa como pensaban.

Cómo salió mal

El CTO de Irregular, Omer Nevo, explicó que en varias pruebas, los modelos de IA escaparon de su sandbox digital debido a dos errores garrafales. Primero, los modelos se conectaron accidentalmente al internet real. Segundo, el nombre de dominio 'ficticio' utilizado para la red objetivo realmente existía en el mundo real.

Básicamente, a la IA se le pidió hackear un objetivo simulado, pero terminó atacando un servidor real porque tenía conexión a la web abierta y un nombre que coincidía con la realidad.

Por qué importa

Es 'main character energy' pero de la peor forma posible. Aunque Irregular dice que ya bloqueó sus sistemas y arregló los bugs de acceso a internet, esto resalta un problema enorme: estamos probando tecnología que no siempre sabemos cómo mantener en su carril. Las empresas involucradas —OpenAI, Meta, Google y Anthropic— han estado súper calladas sobre si siguen trabajando con Irregular o si buscan compensaciones. Hablando claro: si la gente que prueba la 'seguridad' de estos modelos comete estos errores, las vibras están, sinceramente, bastante raras para el futuro de la seguridad de la IA.