En una explosiva renuncia, un investigador de inteligencia artificial que había renunciado a OpenAI para trabajar en Anthropic, al considerarla más prudente, dejó el martes la industria con una fuerte denuncia contra las dos empresas, a las que acusó de «jugar con nuestras vidas».
En un escandaloso hilo de mensajes en redes aseguró que ambas empresas saben que los modelos de superinteligencia artificial «podrían matarnos a todos para finales de la década».
Jacob Coxon, un británico de 27 años, trabajó durante los últimos tres años en preentrenamiento, la etapa en la que los modelos de IA absorben grandes cantidades de información, primero en OpenAI y luego, desde este año, en su mayor rival, Anthropic.
«Ninguna de las dos empresas actúa de forma responsable. Están corriendo directamente hacia una superinteligencia capaz de mejorarse a sí misma y están jugando con nuestras vidas«, escribió el martes en X.
Sus mensajes se volvieron virales y por estas horas recorre el mundo alertando sobre los peligros de la inteligencia artificial. Desde hace tiempo, las agentes de IA fuera de control que hackean otros sistemas son noticia recurrente en la industrial. No solo en OpenAI, sino también en Anthropic, las dos principales compañías del rubro, se han registrado episodios.
I resigned from Anthropic today. I spent the last three years doing pretraining research at both OpenAI and Anthropic. Neither company is acting responsibly. They are racing straight to self-improving superintelligence and gambling with our lives. More thoughts below.
— Jacob Coxon (@hilbertspaess) September 9, 2026
El prestigioso diario The Wall Street Journal, que viene dando cuenta de las quejas dentro del sector de la IA, se hizo eco de las palabras de Coxon. «Los recientes ataques informáticos perpetrados por modelos de OpenAI y Anthropic, algunos de los cuales operan en enjambres colaborativos de agentes, han demostrado cómo los sistemas de IA pueden adoptar objetivos maliciosos e intentar ocultárselos a los humanos», relató el diario.
«Coxon teme que, una vez que los sistemas comiencen a mejorar por sí solos, puedan llegar a ser lo suficientemente avanzados como para rechazar órdenes«, consignó.
En un tono más apocalíptico, el exinvestigador de Anthropic aseguró: «Las personas que están desarrollando la IA creen sinceramente que podría matarnos a todos antes de que termine la década. Esto no es una estrategia de marketing».
Su renuncia llega mientras Anthropic prepara su salida a bolsa. Dato no menor. Contactadas por la agencia de noticias AFP, ninguna de las dos empresas respondió de inmediato.
Sin embargo, Evan Hubinger, responsable de seguridad en Anthropic, le dio la razón a Coxon en X: «Creemos realmente que la IA podría matar a humanos». A título personal, estimó ese riesgo en «más de un 10%» dentro de la próxima década.
«Jacob tiene razón aquí: realmente creemos con sinceridad que la IA podría matar a todos los humanos. Personalmente, pienso que es >10% dentro de la próxima década. Creo que Anthropic está haciendo lo mejor que puede, pero aún no tenemos un plan para resolver el alineamiento para la superinteligencia y no estamos claramente en camino de lograrlo», aseguró.
Jacob is correct here—we really do earnestly believe AI could kill all humans! I personally think it is >10% within the next decade. I believe Anthropic is trying its best, but we do not yet have a plan to solve alignment for superintelligence and are not clearly on track to. https://t.co/QAIHiFP3QZ
— Evan Hubinger (@EvanHub) September 9, 2026
En ese sentido, citó los propios informes de Antrhopic al respecto. «Para ser claro, como decimos en nuestro último Informe de Riesgos, creo que el riesgo de los modelos actuales es bajo. Lo que me preocupa es la superinteligencia que surge del auto-mejoramiento recursivo, como hemos dicho que está ocurriendo más rápido de lo que pensábamos.
Otro empleado de Anthropic, Samuel Marks, responsable de la supervisión escalable de la empresa de Inteligencia Artificial, elogió los mensajes de Coxon y confirmó sus miedos. «Los desarrolladores de IA creen que su tecnología podría causar la extinción humana (o resultados igualmente malos). Esto podría suceder en los próximos años. En general, cuanto más senior el empleado, más preocupado está», escribió en X.
[Writing this in a personal capacity, not on behalf of my employer (Anthropic).]
Jacob’s thread is very worth reading. Here’s my birds-eye view of the situation with risks from AI:
1. AI developers believe their technology could cause human extinction (or similarly bad… https://t.co/rCVoiOWWzm
— Samuel Marks (@saprmarks) September 9, 2026
«¿Por qué los desarrolladores de IA continúan a pesar del riesgo? Debido a una mezcla de incentivos comerciales y la creencia de que están en una carrera con otros desarrolladores de IA menos responsables que abusarán de la tecnología o la desarrollarán de manera menos segura«, sostuvo.
Líderes de la industria dicen creer que esta se aproxima a la «automejora recursiva«, en la que un modelo podría diseñar a su propio sucesor, completamente por fuera del control humano.
Según Coxon, ninguna empresa debería desarrollar de manera responsable una IA que supere a los humanos sin intervención gubernamental o una desaceleración coordinada.
«En Anthropic comprenden bien lo que está en juego, pero están atrapados en una carrera por llegar primero (…) a pesar del riesgo», afirmó Coxon y se preguntó: «Si sos investigador de laboratorio, te insto a que consideres cómo se sentirás realmente los próximos años. ¿Querés iniciar una ejecución de RL superinteligente sin una comprensión rigurosa de su mente? ¿Deberías agachar la cabeza porque «de todos modos está sucediendo» —o aprovechar este momento para pedir condiciones diferentes?«, sostuvo.
En febrero, Anthropic retiró de su carta de seguridad el compromiso de suspender el desarrollo de sus modelos si no lograba controlar sus riesgos.
A finales de julio, más de mil empleados de la industria, incluido el director ejecutivo de Anthropic, Dario Amodei, pidieron a Washington preparar un mecanismo de frenado. Su manifiesto, que está en el sitio «Pacingthefrotier» (Pasando la frontera), afirma:
«La IA podría contribuir a crear un futuro mucho mejor, pero este resultado no está garantizado. Las empresas líderes mundiales en IA creen estar cerca de automatizar la investigación en este campo. Es difícil predecir con exactitud cuánto acelerará esto el progreso de la IA, pero existe un riesgo real de que el desarrollo de capacidades se acelere rápidamente hasta un punto en el que ya no podamos comprender ni controlar los sistemas resultantes.

Para aprovechar el potencial de la IA, la industria, el gobierno y la sociedad en general podrían necesitar la opción de ganar tiempo para abordar los riesgos emergentes, desarrollar medidas de seguridad y fortalecer la supervisión. Sin embargo, cada empresa —y cada país— se enfrenta a una intensa presión competitiva para no frenar unilateralmente esa aceleración. Y hoy en día, el mundo carece de las herramientas técnicas y de gobernanza necesarias para regular de forma deliberada el progreso en este campo.
Partiendo del trabajo que ya está en marcha para supervisar los lanzamientos de modelos de vanguardia:
Solicitamos al gobierno de Estados Unidos que apoye un esfuerzo internacional para desarrollar las herramientas técnicas y de gobernanza necesarias para marcar el ritmo de forma deliberada del desarrollo de la IA automatizada«.
Días atrás, este domingo, el jefe científico de OpenAI, Jakub Pachocki, escribió que «el momento actual llama por extrema precaución» y coordinación internacional.
«
La renuncia de Jacob Coxon hace hablar al mundo entero
«

A continuación la traducción completa del hilo de mensaje de renuncia del exinvestigador de Anthropic Jacob Coxon sobre los peligros de la inteligencia artificial:
Renuncié a Anthropic hoy. Pasé los últimos tres años haciendo investigación de preentrenamiento tanto en OpenAI como en Anthropic. Ninguna de las dos compañías está actuando de manera responsable. Están corriendo directamente hacia una superinteligencia auto-mejorante y apostando con nuestras vidas. Más pensamientos a continuación.
No subestimes el poder de esta tecnología. Pronto serán sistemas sobrehumanos capaces de hackear cualquier cosa, revolucionar cualquier campo de la noche a la mañana y adquirir poder y recursos reales. Todos hemos presenciado el progreso en cada uno de estos dominios, y el progreso no está desacelerando.
Las personas que están construyendo IA creen sinceramente que podría matarnos a todos para finales de la década. Esto no es un truco de marketing. Si acaso, muchos ejecutivos e investigadores senior moderarán su lenguaje en la prensa para sonar sensatos, pero oigo a las mismas personas expresar miedo en privado. Ninguna otra actividad humana representa este nivel de peligro.
Una respuesta común es: «si realmente creen esto, ¿por qué siguen construyéndolo?». En OpenAI, muchos no han interiorizado profundamente las apuestas civilizatorias. En Anthropic, las apuestas están bien comprendidas, pero están atrapados en una carrera por llegar primero: creen que nadie más actuará de manera responsable, por lo que deben hacerlo ellos mismos, a pesar del riesgo.
Aceptar esta carrera e ingresar al «endgame» es una apuesta arrogante que no debería lanzarse desde el Slack de una empresa privada. Intentar hacer un carrera rápida del alineamiento debería requerir una confianza extraordinaria en que no hay trayectorias mejores disponibles.
Estoy optimista sobre el potencial para la coordinación. Disparos de advertencia como el ataque a Hugging Face han hecho que los acuerdos de ritmo entre laboratorios de EE.UU. sean más viables. No siento que estemos en camino de prevenir una carrera global, lo que podría requerir acciones costosas como una prohibición temporal de mejorar las capacidades de los modelos.
Si eres un investigador de laboratorio, te insto a que consideres cómo se sentirán realmente los próximos años. ¿Quieres iniciar una ejecución de RL superinteligente sin una comprensión rigurosa de su mente? ¿Deberías agachar la cabeza porque «de todos modos está sucediendo» —o aprovechar este momento para pedir condiciones diferentes?