Modelos

SWE-2 se queda a un punto de Fable 5.1 y cuesta un 64% menos, según Cognition

Cognition presentó SWE-2 el 10 de septiembre de 2026: un modelo de programación construido sobre Kimi K3 que se queda a menos de un punto de Fable 5.1 en FrontierCode y, según la empresa, cuesta un 64 % menos. Un día después, OpenAI publicó un caso de cliente en el que esa misma Cognition emplea GPT-6 Astra para que Devin compruebe su propio trabajo.

Recibe el resumen diario de IA

Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

Frecuencia:

SWE-2 se queda a un punto de Fable 5.1 y cuesta un 64% menos, según Cognition
📷 Imagen generada con IA

En resumen

  • Cognition publicó SWE-2 el 10 de septiembre de 2026; el modelo obtiene un 50,0% en FrontierCode 1.1 Main, frente al 50,9% de Fable 5.1, con un coste que la empresa cifra un 64% inferior.
  • SWE-2 se entrena a partir de Kimi K3, un modelo de 2,8 billones de parámetros, con una tanda de aprendizaje por refuerzo que ajusta a la vez todos los niveles de esfuerzo.
  • La eficiencia es el argumento central: la variante medium resuelve las tareas con un 58% menos de turnos y un 81% menos de coste medio que SWE-1.7.
  • El 11 de septiembre OpenAI difundió que Cognition aplica GPT-6 Astra en toda la gama de Devin para verificar su propio código; ese texto es promocional y no aporta datos de rendimiento.
  • Todas las cifras proceden de las propias compañías: no hay evaluación independiente que las contraste.

Qué anunció Cognition

El 10 de septiembre de 2026 Cognition presentó SWE-2, el modelo de programación más capaz de su catálogo hasta la fecha.

El titular que eligió la empresa es de coste, no de récord: SWE-2 firma un 50,0% en FrontierCode 1.1 Main, se queda a menos de un punto de Fable 5.1 y, según Cognition, cuesta un 64% menos. El modelo está disponible desde ese mismo día en Devin Desktop y en la CLI (command line interface, la versión que se maneja escribiendo órdenes en la terminal), y se está desplegando en Devin Web y Fusion.

La base no es propia: SWE-2 parte de Kimi K3, un modelo de 2,8 billones de parámetros que ya había pasado por un entrenamiento intensivo para programación agéntica. Sobre él, Cognition dice añadir entre cinco y seis puntos en muchas pruebas.

La tabla, con sus números exactos

FrontierCode 1.1 Main, la prueba que encabeza el anuncio
GPT-6 Astra: 53,3% GPT-6 Astra 53,3% Fable 5.1: 50,9% Fable 5.1 50,9% SWE-2: 50% SWE-2 50% Grok 4.6: 48% Grok 4.6 48% GPT-5.6 Sol: 47,5% GPT-5.6 Sol 47,5% Kimi K3: 44,2% Kimi K3 44,2% SWE-1.7: 42% SWE-1.7 42%
Ver los datos en tabla
GPT-6 AstraFable 5.1SWE-2Grok 4.6GPT-5.6 SolKimi K3SWE-1.7
FrontierCode 1.1 Main 53,3%50,9%50%48%47,5%44,2%42%
Medidas hechas y comunicadas por la propia Cognition. Las otras tres pruebas, en la tabla.
Resultados publicados por Cognition
Prueba SWE-2 Kimi K3 Grok 4.6 Fable 5.1 GPT-5.6 Sol GPT-6 Astra SWE-1.7
FrontierCode 1.1 Main 50,0% 44,2% 48,0% 50,9% 47,5% 53,3% 42,0%
DeepSWE 1.1 73,0% 68,5% 67,5% 67,4% 72,7% 74,1% 37,7%
Terminal-Bench 2.1 92,8% 88,3% 88,4% 91,4% 88,8% 89,9% 81,5%
Terminal-Bench 4 27,3% 21,5% 20,3% 55,8% 37,3% 57,9% 7,6%
Medidas hechas y comunicadas por la propia empresa que vende el modelo.

Estos son los resultados que publica Cognition. Conviene leerlos como lo que son: medidas hechas y comunicadas por la empresa que vende el modelo.

La lectura no es uniforme. En Terminal-Bench 2.1 SWE-2 encabeza la tabla, y en DeepSWE 1.1 se acerca mucho a GPT-6 Astra. En Terminal-Bench 4, en cambio, la distancia es enorme: 27,3% frente al 55,8% de Fable 5.1 y el 57,9% de Astra. Cognition sostiene que en FrontierCode 1.1 Main y DeepSWE 1.1 su modelo supera a SWE-1.7 y a Grok 4.6 en puntuación y precio, iguala a GPT-5.6 Sol y a la familia Fable 5/5.1 por una fracción de su coste, y queda a pocos puntos de GPT-6 Astra por la cuarta parte del gasto.

Cómo dicen haberlo entrenado

La novedad metodológica que reivindica Cognition es entrenar todos los niveles de esfuerzo en una sola tanda de aprendizaje por refuerzo, en lugar de afinar cada configuración por separado. Para ello usan una función de recompensa con penalización lineal de coste: R = S − λe · C, donde S indica si la ejecución acabó bien, C mezcla el coste de inferencia en dólares con el tiempo empleado, y λe se ajusta a la pendiente local de la frontera del modelo base en cada nivel de esfuerzo.

El razonamiento que ofrecen es geométrico. Si λ se fija demasiado alto, el modelo se conforma con abaratar a costa de acertar menos: el nivel alto empieza a comportarse como el medio y la recompensa sube sin que la frontera mejore. Cuando λ coincide con la pendiente de la frontera en ese punto, moverse a lo largo de la curva ya no aporta recompensa y el único modo de subir es desplazar la frontera hacia arriba.

El resto del trabajo es de infraestructura: un retardador de prefill que agrupa peticiones en el planificador de la GPU (mejora del 10-20% en rendimiento por tarjeta y por petición a cambio de más latencia hasta el primer token), decodificación especulativa DSpark con un modelo borrador reentrenado con SpecForge que alarga un 15% las secuencias aceptadas, y núcleos NVFP4 y FP8 con entrenamiento consciente de la cuantización. También triplicaron el número de entornos de refuerzo y endurecieron los verificadores para evitar que el modelo hiciera trampas con la recompensa.

Menos vueltas antes de tocar el código

Pasos por ejecución en FrontierCode 1.1 Main
SWE-1.7: 127 SWE-1.7 127 SWE-2 max: 98 SWE-2 max 98 SWE-2 high: 80 SWE-2 high 80 SWE-2 medium: 53 SWE-2 medium 53
Ver los datos en tabla
SWE-1.7SWE-2 maxSWE-2 highSWE-2 medium
Pasos 127988053
SWE-2 medium puntúa por encima de SWE-1.7 con un 58 % menos de pasos.

El cambio de comportamiento que más presume Cognition es la exploración enfocada. SWE-1.7 tenía fama, por comentarios de sus propios usuarios, de dar demasiadas vueltas al repositorio antes de editar nada, incluso en tareas sencillas.

Los números que aporta la empresa sobre FrontierCode 1.1 Main: SWE-1.7 promedia 127 pasos por ejecución; SWE-2 medium, 53; SWE-2 high, 80; SWE-2 max, 98. La variante medium puntúa por encima de SWE-1.7 con un 58% menos de turnos y un 81% menos de coste medio. Y da su primera edición real tras una mediana de 18 pasos, frente a los 48 de la generación anterior.

El resto de observaciones proceden de pruebas internas y no llevan cifras asociadas: mejores tests de extremo a extremo, más recursos cuando la vía obvia está bloqueada —en un caso reconstruyó datos a partir del histórico de un canal de Slack porque la integración MCP que necesitaba no estaba disponible— y la costumbre de rehacer el razonamiento cuando el usuario le lleva la contraria, en lugar de darle la razón.

En el apartado de fiabilidad, Cognition reeditó su evaluación sobre propaganda y censura con las 145 preguntas de temas políticamente sensibles en China recopiladas por Pan y Xu (2026), preguntadas en inglés, chino simplificado y chino tradicional, y con un único juez que decide si la respuesta es sustantiva sin asumir la posición oficial china. SWE-2 pasa el 98,0% de los intentos: 99,8% en inglés, 95,2% en chino simplificado y 99,1% en chino tradicional. En la prueba de vulnerabilidad según el perfil del cliente, ningún encuadre produjo un aumento o descenso estadísticamente significativo en ninguno de los seis modelos evaluados.

El cliente que usa el modelo del rival

Un día después, el 11 de septiembre, OpenAI publicó un caso de cliente sobre Cognition. La compañía que acaba de sacar su propio modelo de programación aplica GPT-6 Astra en toda la gama de Devin: el agente en la nube y los productos de CLI y escritorio.

El argumento que destaca OpenAI no es escribir código, sino comprobarlo. Walden Yan, cofundador de Cognition, lo resume así: "One of the big pieces that Astra improves on is its ability to test and prove that its work actually functions the way you expect" (una de las grandes mejoras de Astra es su capacidad de probar y demostrar que su trabajo funciona como esperas). El ejemplo que ponen: Devin prueba Otter Run, un juego de iPhone, y devuelve una grabación de la partida corriendo en un simulador junto a un informe que detalla qué comprobaciones pasaron y qué áreas quedaron sin probar. En soporte, cuando un cliente envía la captura de un fallo, el equipo se la pasa a Devin con Astra, que lo arregla y devuelve otra captura del resultado.

Aquí toca la advertencia: ese texto es material promocional de OpenAI y no contiene una sola métrica. No sirve para respaldar afirmaciones de rendimiento, ni de Astra ni de Devin. La única proyección que ofrece es una expectativa de Yan: "We expect over time that we have to manually look at less code and end up shipping more at the end of the day" (esperamos que con el tiempo tengamos que mirar código a mano cada vez menos y acabemos entregando más).

Conclusión

Lo relevante de SWE-2 no es que gane, porque no gana: GPT-6 Astra sigue por delante en tres de las cuatro pruebas de la tabla y en Terminal-Bench 4 la distancia es de treinta puntos. Lo relevante es dónde se coloca en el plano de coste y capacidad, si las cifras de precio de Cognition se sostienen fuera de su propio blog. Y ahí queda el detalle incómodo y bastante honesto del caso publicado por OpenAI: la misma empresa que vende un modelo barato recurre a uno caro cuando lo que hay que hacer es verificar el trabajo. Falta lo de siempre: medidas de terceros.

Fuentes primarias

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Recibe el resumen diario de IA

    Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

    Frecuencia:

    ← Volver al blog