Seguridad
Un investigador deja Anthropic y alerta del riesgo existencial
El martes 8 de septiembre, Jacob Coxon, investigador de seguridad y alignment (alineamiento: la disciplina que busca que los sistemas de IA persigan los objetivos que sus creadores pretenden) con experiencia previa tanto en OpenAI como en Anthropic, presentó su dimisión en esta última. Esa misma noche explicó sus motivos en X: sostiene que Anthropic y OpenAI están "jugando con nuestras vidas". El mensaje superó los 70 millones de visualizaciones según CNBC y el miércoles 9 lo recogieron BBC, CNBC, Forbes y la prensa española, entre ella El País y ABC. Recuperamos hoy el caso porque se ha cruzado con un desarrollo posterior que cambia su lectura: Anthropic está a punto de comercializar su salida a bolsa.
Recibe el resumen diario de IA
Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.
Al suscribirte aceptas recibir el newsletter de AI Informator. Puedes darte de baja cuando quieras.
En resumen
- Jacob Coxon dimitió de Anthropic el martes 8 de septiembre y publicó esa noche en X que la compañía y OpenAI están "jugando con nuestras vidas".
- Coxon estima en más del 10% la probabilidad de que la IA "mate a todos los humanos" en la próxima década y afirma que quienes construyen estos sistemas "creen sinceramente que podría matarnos a todos antes del final de la década".
- Anthropic publicó el mes pasado un informe que califica de "bajo" el riesgo de descontrol de sus modelos, pero elevó el nivel desde "muy bajo".
- El caso coincide con la inminente comercialización de la IPO de Anthropic, lo que abre la pregunta de cómo defenderá ese mensaje ante los inversores.
Qué dijo Coxon y cuándo lo dijo
La cronología importa para entender el alcance del caso. Coxon dimitió el martes 8 de septiembre de 2026. Esa misma noche publicó en X el mensaje en el que atribuía su salida a que, en su opinión, Anthropic y OpenAI están "jugando con nuestras vidas". En ese texto añadió que quienes construyen estos sistemas "creen sinceramente que podría matarnos a todos antes del final de la década".
Coxon cuantificó su propia valoración: sitúa por encima del 10% la probabilidad de que la IA "mate a todos los humanos" en la próxima década. Es una estimación personal, expresada en primera persona, no una cifra corporativa ni el resultado de un estudio publicado.
La difusión fue inmediata. Según CNBC, la publicación superó los 70 millones de visualizaciones. El miércoles 9 de septiembre la recogieron BBC News, CNBC —que fechó su pieza a las 03:06 EDT y la actualizó a las 13:43 EDT—, Forbes y medios españoles como El País y ABC, este último hacia las 10:50 CET. El perfil de Coxon añade peso al mensaje: ha trabajado en los dos laboratorios a los que señala.
El informe de Anthropic y el matiz que se pasó por alto
El mes pasado Anthropic publicó un informe en el que evalúa como "bajo" el riesgo de que sus modelos se descontrolen. Leído aisladamente, es un mensaje tranquilizador. El detalle relevante es otro: ese nivel supone una subida respecto a la calificación anterior, que era "muy bajo".
El mismo informe emplea la fórmula "riesgo bajo, pero con incertidumbre sustancial" al referirse a la posibilidad de que actores maliciosos utilicen sus modelos para desarrollar armas químicas o biológicas, según recogió The Information en su Briefing del 9 de septiembre. La incertidumbre declarada forma parte del propio texto de la compañía.
Conviene separar los planos: una cosa es la evaluación interna de riesgo que publica un laboratorio y otra la estimación individual de un investigador que acaba de dimitir. No son documentos equivalentes ni tienen el mismo estatus. Lo que sí comparten es la dirección del movimiento: el riesgo declarado ha subido, no bajado.
El choque con la salida a bolsa
Aquí está el desarrollo que justifica volver hoy sobre el caso. Anthropic está a punto de comercializar su salida a bolsa (IPO, oferta pública inicial). El proceso implica un roadshow: la ronda de presentaciones en la que los directivos exponen la compañía ante inversores institucionales.
La pregunta que se plantea en el sector, formulada por Martin Peers en el Briefing de The Information del 9 de septiembre, es cómo defenderá Anthropic ese mensaje ante los inversores. La compañía ha construido buena parte de su identidad pública sobre la seguridad de la IA, y ese posicionamiento tiene ahora que convivir con un exinvestigador que sostiene públicamente que el riesgo es inaceptable.
El contexto político tampoco ayuda a que el asunto se enfríe. La semana pasada, el senador Bernie Sanders pidió una prohibición del desarrollo de IA. Son dos presiones de naturaleza distinta —una reputacional, otra regulatoria— que confluyen en el peor momento posible desde el punto de vista del calendario financiero.
Un debate que no es unánime
El caso ha reactivado la discusión sobre las estimaciones de p(doom), la abreviatura con la que en el sector se designa la probabilidad subjetiva que cada persona asigna a un desenlace catastrófico causado por la IA. Los expertos consultados por CNBC discrepan sobre su utilidad.
El desacuerdo no es sobre si existe riesgo, sino sobre si ponerle un número aporta algo. Quienes defienden la práctica argumentan que obliga a explicitar creencias que de otro modo quedarían difusas. Quienes la critican señalan que una cifra sin metodología detrás transmite una precisión que no existe y desplaza el debate hacia la aritmética en lugar de hacia las medidas concretas.
Para el lector, la conclusión operativa es modesta: la estimación de Coxon informa sobre lo que Coxon piensa, no sobre lo que va a ocurrir. Su valor está en el contexto —quién la formula y desde dónde—, no en el porcentaje.
Conclusión
El caso no aporta datos nuevos sobre las capacidades de los modelos, pero sí sobre las tensiones internas de los laboratorios que los construyen. Una dimisión con carta abierta, un informe propio que sube el nivel de riesgo y una salida a bolsa inminente son tres hechos independientes que han coincidido en la misma semana. Lo que queda por ver es si esa coincidencia altera algo del proceso: por ahora, ni Anthropic ha modificado públicamente su calendario ni el debate sobre las estimaciones de riesgo ha alcanzado consenso alguno.
Fuentes primarias
Recibe el resumen diario de IA
Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.
Al suscribirte aceptas recibir el newsletter de AI Informator. Puedes darte de baja cuando quieras.
Comentarios