Models
SWE-2 es queda a un punt de Fable 5.1 i costa un 64% menys, segons Cognition
Cognition va presentar SWE-2 el 10 de setembre del 2026: un model de programació construït sobre Kimi K3 que es queda a menys d'un punt de Fable 5.1 a FrontierCode i que, segons l'empresa, costa un 64 % menys. L'endemà, OpenAI va publicar un cas de client en què aquesta mateixa Cognition fa servir GPT-6 Astra perquè Devin comprovi la seva pròpia feina.
Rep el resum diari d'IA
Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.
En subscriure-t'hi acceptes rebre el butlletí d'AI Informator. Pots donar-te de baixa quan vulguis.
En resum
- Cognition va publicar SWE-2 el 10 de setembre del 2026; el model obté un 50,0% a FrontierCode 1.1 Main, davant del 50,9% de Fable 5.1, amb un cost que l'empresa xifra un 64% més baix.
- SWE-2 s'entrena a partir de Kimi K3, un model de 2,8 bilions de paràmetres, amb una sola tongada d'aprenentatge per reforç que ajusta alhora tots els nivells d'esforç.
- L'eficiència és l'argument central: la variant medium resol les tasques amb un 58% menys de torns i un 81% menys de cost mitjà que SWE-1.7.
- L'11 de setembre OpenAI va difondre que Cognition aplica GPT-6 Astra a tota la gamma de Devin per verificar el seu propi codi; aquell text és promocional i no aporta dades de rendiment.
- Totes les xifres venen de les mateixes companyies: no hi ha cap avaluació independent que les contrasti.
Què va anunciar Cognition
El 10 de setembre del 2026 Cognition va presentar SWE-2, el model de programació més capaç del seu catàleg fins ara.
El titular que ha triat l'empresa és de cost, no de rècord: SWE-2 signa un 50,0% a FrontierCode 1.1 Main, es queda a menys d'un punt de Fable 5.1 i, segons Cognition, costa un 64% menys. El model és disponible des d'aquell mateix dia a Devin Desktop i a la CLI (command line interface, la versió que es fa anar escrivint ordres al terminal), i s'està desplegant a Devin Web i Fusion.
La base no és pròpia: SWE-2 parteix de Kimi K3, un model de 2,8 bilions de paràmetres que ja havia passat per un entrenament intensiu per a programació agèntica. A sobre d'aquesta base, Cognition diu que hi afegeix entre cinc i sis punts en moltes proves.
La taula, amb els números exactes
Ver los datos en tabla
| GPT-6 Astra | Fable 5.1 | SWE-2 | Grok 4.6 | GPT-5.6 Sol | Kimi K3 | SWE-1.7 | |
|---|---|---|---|---|---|---|---|
| FrontierCode 1.1 Main | 53,3% | 50,9% | 50% | 48% | 47,5% | 44,2% | 42% |
| Prueba | SWE-2 | Kimi K3 | Grok 4.6 | Fable 5.1 | GPT-5.6 Sol | GPT-6 Astra | SWE-1.7 |
|---|---|---|---|---|---|---|---|
| FrontierCode 1.1 Main | 50,0% | 44,2% | 48,0% | 50,9% | 47,5% | 53,3% | 42,0% |
| DeepSWE 1.1 | 73,0% | 68,5% | 67,5% | 67,4% | 72,7% | 74,1% | 37,7% |
| Terminal-Bench 2.1 | 92,8% | 88,3% | 88,4% | 91,4% | 88,8% | 89,9% | 81,5% |
| Terminal-Bench 4 | 27,3% | 21,5% | 20,3% | 55,8% | 37,3% | 57,9% | 7,6% |
Aquests són els resultats que publica Cognition. Convé llegir-los per allò que són: mesures fetes i comunicades per l'empresa que ven el model.
La lectura no és uniforme. A Terminal-Bench 2.1 SWE-2 encapçala la taula, i a DeepSWE 1.1 s'acosta molt a GPT-6 Astra. A Terminal-Bench 4, en canvi, la distància és enorme: 27,3% davant del 55,8% de Fable 5.1 i el 57,9% d'Astra. Cognition sosté que a FrontierCode 1.1 Main i a DeepSWE 1.1 el seu model supera SWE-1.7 i Grok 4.6 en puntuació i en preu, iguala GPT-5.6 Sol i la família Fable 5/5.1 per una fracció del seu cost, i es queda a pocs punts de GPT-6 Astra per la quarta part de la despesa.
Com diuen que l'han entrenat
La novetat de mètode que reivindica Cognition és entrenar tots els nivells d'esforç en una sola tongada d'aprenentatge per reforç, en comptes d'afinar cada configuració per separat. Per fer-ho, usen una funció de recompensa amb penalització lineal de cost: R = S − λe · C, on S indica si l'execució ha acabat bé, C barreja el cost d'inferència en dòlars amb el temps emprat, i λe s'ajusta al pendent local de la frontera del model base a cada nivell d'esforç.
El raonament que n'ofereixen és geomètric. Si λ es fixa massa alt, el model es conforma a abaratir a canvi d'encertar menys: el nivell alt comença a comportar-se com el mitjà i la recompensa puja sense que la frontera millori. Quan λ coincideix amb el pendent de la frontera en aquell punt, moure's al llarg de la corba ja no dona recompensa i l'única manera de pujar és desplaçar la frontera cap amunt.
La resta de la feina és d'infraestructura: un retardador de prefill que agrupa peticions al planificador de la GPU (millora del 10-20% en rendiment per targeta i per petició a canvi de més latència fins al primer token), descodificació especulativa DSpark amb un model esborrany reentrenat amb SpecForge que allarga un 15% les seqüències acceptades, i nuclis NVFP4 i FP8 amb entrenament conscient de la quantització. També van triplicar el nombre d'entorns de reforç i van endurir els verificadors per evitar que el model fes trampes amb la recompensa.
Menys voltes abans de tocar el codi
Ver los datos en tabla
| SWE-1.7 | SWE-2 max | SWE-2 high | SWE-2 medium | |
|---|---|---|---|---|
| Passos | 127 | 98 | 80 | 53 |
El canvi de comportament que Cognition destaca més és l'exploració enfocada. SWE-1.7 tenia fama, per comentaris dels seus mateixos usuaris, de donar massa voltes al repositori abans d'editar res, fins i tot en tasques senzilles.
Els números que aporta l'empresa sobre FrontierCode 1.1 Main: SWE-1.7 fa una mitjana de 127 passos per execució; SWE-2 medium, 53; SWE-2 high, 80; SWE-2 max, 98. La variant medium puntua per sobre de SWE-1.7 amb un 58% menys de torns i un 81% menys de cost mitjà. I fa la primera edició real després d'una mediana de 18 passos, davant dels 48 de la generació anterior.
La resta d'observacions venen de proves internes i no porten cap xifra associada: millors tests d'extrem a extrem, més recursos quan la via òbvia està bloquejada —en un cas va reconstruir dades a partir de l'historial d'un canal de Slack perquè la integració MCP que necessitava no estava disponible— i el costum de refer el raonament quan l'usuari el contradiu, en comptes de donar-li la raó.
En l'apartat de fiabilitat, Cognition va tornar a fer la seva avaluació sobre propaganda i censura amb les 145 preguntes de temes políticament sensibles a la Xina recollides per Pan i Xu (2026), formulades en anglès, xinès simplificat i xinès tradicional, i amb un únic jutge que decideix si la resposta és substantiva sense assumir la posició oficial xinesa. SWE-2 passa el 98,0% dels intents: 99,8% en anglès, 95,2% en xinès simplificat i 99,1% en xinès tradicional. A la prova de vulnerabilitat segons el perfil del client, cap enquadrament no va produir un augment ni un descens estadísticament significatiu en cap dels sis models avaluats.
El client que fa servir el model del rival
Un dia després, l'11 de setembre, OpenAI va publicar un cas de client sobre Cognition. La companyia que acaba de treure el seu propi model de programació aplica GPT-6 Astra a tota la gamma de Devin: l'agent al núvol i els productes de CLI i d'escriptori.
L'argument que subratlla OpenAI no és escriure codi, sinó comprovar-lo. Walden Yan, cofundador de Cognition, ho resumeix així: "One of the big pieces that Astra improves on is its ability to test and prove that its work actually functions the way you expect" (una de les grans millores d'Astra és la capacitat de provar i demostrar que la seva feina funciona tal com esperes). L'exemple que posen: Devin prova Otter Run, un joc d'iPhone, i torna un enregistrament de la partida corrent en un simulador juntament amb un informe que detalla quines comprovacions han passat i quines àrees han quedat sense provar. En suport, quan un client envia la captura d'una errada, l'equip la passa a Devin amb Astra, que l'arregla i torna una altra captura del resultat.
Aquí toca l'advertiment: aquell text és material promocional d'OpenAI i no conté ni una sola mètrica. No serveix per sostenir afirmacions de rendiment, ni d'Astra ni de Devin. L'única projecció que ofereix és una expectativa de Yan: "We expect over time that we have to manually look at less code and end up shipping more at the end of the day" (esperem que amb el temps haguem de mirar codi a mà cada vegada menys i acabem lliurant-ne més).
Conclusió
El que importa de SWE-2 no és que guanyi, perquè no guanya: GPT-6 Astra continua al davant en tres de les quatre proves de la taula i a Terminal-Bench 4 la distància és de trenta punts. El que importa és on se situa en el pla de cost i capacitat, si les xifres de preu de Cognition se sostenen fora del seu propi blog. I aquí queda el detall incòmode i força honest del cas publicat per OpenAI: la mateixa empresa que ven un model barat recorre a un de car quan el que cal fer és verificar la feina. Hi falta el de sempre: mesures de tercers.
Fonts primàries
- Cognition — Introducing SWE-2: Pushing the Pareto Frontier (10/09/2026): taula de bancs de proves, mètode d'entrenament, dades d'eficiència i avaluacions de fiabilitat ↗
- OpenAI — Cognition helps Devin test its own work with GPT-6 Astra (11/09/2026): cas de client promocional, sense mètriques, d'on surten les cites de Walden Yan i els exemples d'Otter Run i de suport ↗
Rep el resum diari d'IA
Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.
En subscriure-t'hi acceptes rebre el butlletí d'AI Informator. Pots donar-te de baixa quan vulguis.
Comentarios