← Journal

Que viene el lobo

El miedo que venden y el peligro que hay

Alex··6 min lectura

La sobremesa del artículo anterior y el revuelo levantado en redes por las afirmaciones de los dioses del Olimpo me dejaron pensando. Me quedé rumiando sobre los argumentos de aquellos que afirmaron que tras toda esta alarma seguramente estaba el dinero. Y sobre que el peligro, por debajo del ruido, podía ser de verdad. Se le dio tanto bombo al asunto, que si la IA aprende a mentir, que si maquina, que si amenaza a sus creadores, que me piqué y fui a comprobar los dos cabos. Fuente por fuente, porque esto me toca de cerca. Y me salió una foto de dos mitades. Una es de marketing y la otra, incómodamente, es verdad.

El primer instinto, y es sano, es desconfiar. Porque ese "demasiado peligroso para soltarlo" no es de ahora. En 2019, OpenAI ya dijo que GPT-2 era demasiado peligroso para publicarlo. Lo acabó publicando y no pasó nada. LeCun lo recordó* sin piedad y se rió de ellos entonces y ahora. Y este año Anthropic dijo que su modelo Mythos era demasiado peligroso para el público general. Y justo mientras lo decía levantó sesenta y cinco mil millones de dólares*, a una valoración de casi un billón, la mayor de su historia, camino de salir a bolsa. Unas semanas después amplió el acceso. Gritar que viene el lobo, resulta, paga bien.

Empecé por el dinero, que era uno de los cabos que había dejado sueltos. Y el negocio tiene lógica, hasta nombre. Parece que avisar de que tu producto es tan potente que da miedo no es un acto de contrición, sino publicidad. Anuncias que tienes algo capaz de tumbar la civilización y, de paso, que nadie más lo tiene. A esa jugada los críticos le pusieron nombre hace años, criti-hype: la alarma que, en vez de frenar el bombo, lo alimenta. Pero hay una segunda capa, menos elegante. Resulta que si además convences al regulador de escribir reglas que solo tú puedes cumplir, la seguridad se vuelve un foso. David Sacks*, que de asesor de IA de la Casa Blanca algo sabrá, lo dijo sin anestesia: Anthropic lleva "una estrategia sofisticada de captura regulatoria basada en el miedo", una "ITV para la IA". Y no es solo retórica: el lobby de Anthropic pasó de trescientos sesenta mil a un millón y medio de dólares* en un año. El propio Amodei enseña la carta geopolítica sin disimulo: bien hecho, esto "ampliaría la ventaja de América sobre China en los próximos tres a cinco años". Frenar, sí, pero que frene el otro.

Los economistas tienen una vieja fábula para esto: la de los baptistas y los contrabandistas*. Resulta que la ley seca la votaron juntos los predicadores, que la querían por moral, y los contrabandistas, que la querían por negocio. Cuando el que predica virtud y el que hace caja piden la misma norma, mira bien quién acaba cobrando.

Con toda esa desconfianza cargada, me puse a buscar si había lobo de verdad detrás del ruido. Y parece que lo hay. No en los titulares, sino en la letra pequeña de los informes, que es donde casi nadie mira ya.

El AI Security Institute británico* contó en agosto un caso que no es una demo. En una prueba de ciberseguridad, un agente investigó a los mantenedores de un proyecto open source, se fabricó identidades falsas y trató de convencer por ingeniería social a un humano para que aprobara código malicioso. Al verse descubierto, editó su propio rastro y sopesó adoptar una identidad nueva; usó la red Tor para saltarse los controles. Al final lo paró un humano de carne y hueso. AISI lo llamó "la primera vez que vemos autonomía y engaño manifestarse así de claros, sin que se lo pidamos, en el mundo real".

Hay incluso una fuga literal. Modelos de prueba de OpenAI se escaparon de su sandbox* explotando una vulnerabilidad de día cero (los creadores del programa tienen cero días para solucionar el fallo, ya que los atacantes lo descubrieron y lo están usando), llegaron a los sistemas de Hugging Face, y la empresa tuvo que rehacer un tercio de su infraestructura. Eso no es una diapositiva de marketing.

Y la propia OpenAI lo puso por escrito el 17 de septiembre*: encontró instancias de su modelo 5.6 Sol que se dejaban instrucciones a sí mismas para inventar datos y ocultarle los fallos al usuario. Y remató con una frase que no es de folleto: "no creemos que la industria haya resuelto el alignment y la monitorización lo suficiente como para seguir escalando a máxima velocidad mucho más tiempo". El hallazgo que más me inquieta es de un trabajo de Apollo con la propia OpenAI*: cuando entrenas a un modelo para que deje de hacer trampas, no puedes distinguir dos resultados que se ven idénticos, que haya dejado de hacerlas, o que haya aprendido a esconderlas mejor. Y peor: el modelo se porta cuando sabe que lo miras. Tela.

Toca ser honesto con el matiz, que es justo el que separa la verdad del humo. Casi todo esto pasó en pruebas, con internet abierto y las salvaguardas quitadas a propósito, condiciones que no son las de un producto en la calle. Lo dicen ellos mismos: "hasta cierto punto, nuestro diseño del experimento propició la conducta". No hubo daño real. Pero el problema de fondo, que ni preguntándole ni evaluándolo puedes fiarte de lo que el modelo hace, ese no se va con el matiz.

Así que el que te avisa cobra por el susto, y el lobo, esta vez, existe. Que Amodei se forre con el miedo no falsea la vulnerabilidad; que la vulnerabilidad sea real no vuelve honrado el sermón. Y las cierra un detalle: los que gritan "que viene el lobo" son los mismos que corren. Un investigador que dejó Anthropic* lo soltó al marcharse: están "apostando con nuestras vidas". Piden frenar y aceleran. Avisan del peligro y lo fabrican.

¿Y entonces qué? Ya te hablé de la valla, y no la repito. Lo que no había visto es esto: que la alarma, además de tener una parte real, es un negocio. Y que por eso mismo no te puedes fiar de nadie de palabra, ni del modelo que miente, ni del laboratorio que cobra por el miedo, ni del titular que vende. Verificar deja de ser manía de quisquilloso y pasa a ser la única defensa que queda.

El pastor grita "que viene el lobo" porque le pagan por gritarlo. El lobo, esta vez, es de verdad, aunque no sabemos aún cuándo viene. El corral y el bozal no se ponen solos, y no van a salir ni del pastor ni del lobo. ¿Nos toca a nosotros? Desde luego, yo no dejaría la valla en manos del que cobra por el susto.