Recerca
Sakana AI: xarxes neuronals sense retropropagació
El laboratori japonès Sakana AI diu que ha entrenat xarxes neuronals de fins a 1.000 capes sense fer servir la retropropagació, però qui ho anuncia és la mateixa empresa al seu blog: l'estudi que ha publicat es queda en 128 capes i no ha passat revisió per parells ni l'ha repetit cap equip de fora. Una xarxa neuronal s'entrena mesurant l'error al final i tornant-lo enrere, capa per capa, fins a la primera: això és la retropropagació, i així es fa des de fa quaranta anys. Prescindir-ne canviaria el que cal per entrenar, perquè és la retropropagació la que obliga a desar a la memòria els resultats intermedis de tota la xarxa i fa que cap capa no aprengui fins que li arriba l'avís des de l'altre extrem.
Rep el resum diari d'IA
Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.
En subscriure-t'hi acceptes rebre el butlletí d'AI Informator. Pots donar-te de baixa quan vulguis.
En resum
- El preprint «Augmented Lagrangian Predictive Coding», de Jeffrey Seely i Julian Gould, va sortir a arXiv el 29 de maig del 2026 i només té una versió.
- L'abast que declara arriba fins a 128 capes, amb MNIST i Fashion-MNIST, MLP residuals i una època d'entrenament.
- El resultat de les 1.000 capes el publica la mateixa empresa al seu blog el setembre del 2026, sense revisió per parells i sense replicació externa.
- L'únic número comparable que ofereix Sakana és aproximat: PC-ALM es queda a uns dos punts percentuals de la retropropagació en tot el rang de profunditats.
- La implementació de referència, en JAX i amb llicència MIT, cobreix la graella del preprint en MNIST i Fashion-MNIST: ni les 1.000 capes, ni CIFAR-10, ni Tiny ImageNet.
Entrenar sense recórrer tota la xarxa cap enrere
Sakana AI —fundada el 2023 a Tòquio per tres antics investigadors de Google: Llion Jones, coautor d'«Attention Is All You Need», David Ha i Ren Ito— presenta PC-ALM, un mètode d'entrenament que prescindeix d'aquesta passada cap enrere. Segons la premsa financera, la seva sèrie B va ser de 135 milions de dòlars amb una valoració posterior de 2.650 milions el novembre del 2025, i entre els seus inversors hi ha fons de capital de risc nord-americans com Khosla Ventures i Lux Capital.
La motivació que declara no és competir en rendiment, sinó entendre com el cervell reparteix el crèdit entre les neurones sense res que s'assembli a la retropropagació. Entre les aplicacions possibles, l'empresa esmenta el maquinari neuromòrfic.
Cada capa parla només amb les veïnes immediates
Sakana anomena «balística» aquesta manera de repartir el senyal, per oposició a la «difusiva» de la codificació predictiva clàssica, que segons la seva descripció s'apaga abans d'arribar a les primeres capes. Aquest és el problema que el mètode diu que resol: que l'avís arribi fins al principi de la pila, per llarga que sigui.
Sobre les xarxes molt profundes, el blog afirma que, «fins on sabem, aquest és el primer mètode local per capes del qual s'ha mostrat que entrena amb èxit xarxes de fins a 1.000 capes». És una afirmació de la mateixa empresa, sense cap replicació externa que l'avali.
L'únic número comparable surt d'un peu de figura
Ni el preprint ni el blog ni el repositori publiquen cap taula de precisions: el preprint porta equacions i un quadre de cost en notació asimptòtica, i el blog, mapes de calor i corbes, sense ni un valor escrit. L'única dada comparable és al peu d'una figura: PC-ALM «es queda dins d'uns 2 punts percentuals» de la retropropagació en MNIST al llarg de tot el rang de profunditats, incloses les 1.000 capes. És aproximat, és dels mateixos autors del mètode i es refereix al rang sencer.
Aquest experiment fa servir un MLP residual d'amplada 32, activació ReLU, cinc èpoques i un pressupost d'inferència de dos passos per capa. La graella principal del preprint és una altra: amplades i profunditats de 8, 16, 32, 64 i 128, una sola època i la mateixa llavor per als tres mètodes comparats.
El que prova el preprint no és el que ensenya el blog
| Què es compara | Preprint (maig, arXiv) | Blog de l'empresa (setembre) | Repositori |
|---|---|---|---|
| Profunditat màxima | 128 capes | 1.000 capes | La graella del preprint |
| Conjunts de dades | MNIST i Fashion-MNIST | Hi afegeix CIFAR-10 i Tiny ImageNet | MNIST i Fashion-MNIST |
| Arquitectures | MLP residuals | Hi afegeix ResNet-18 | MLP residuals |
| Entrenament | Una època | Cinc èpoques a l'experiment de 1.000 capes | — |
| Revisió per parells | No: és un preprint | No | — |
L'apartat de limitacions del preprint ho diu sense embuts: «els experiments es restringeixen a MNIST i Fashion-MNIST, MLP residuals i una època d'entrenament». El que circula com a titular del treball —les 1.000 capes, i amb elles CIFAR-10, Tiny ImageNet i ResNet-18— només és a l'entrada del blog corporatiu, publicada el setembre del 2026.
Res d'això no invalida el mètode, i el codi publicat permet comprovar la part revisable: funciona en CPU i reprodueix la graella del preprint. Però les dues afirmacions tenen suports diferents.
Conclusió
Un mètode que entreni sense retropropagació canviaria el que cal per entrenar una xarxa: ni desar els resultats intermedis de tota la pila, ni esperar que l'error torni des del final. PC-ALM apunta en aquesta direcció amb una implementació oberta que qualsevol pot executar, i es queda per sota de la retropropagació, no per sobre. Hi falta el de sempre: que el resultat més cridaner passi per una revisió i que el repeteixi algú de fora.
Fonts primàries
Rep el resum diari d'IA
Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.
En subscriure-t'hi acceptes rebre el butlletí d'AI Informator. Pots donar-te de baixa quan vulguis.
Comentarios