Investigación

Sakana AI: nuevos entrenamientos para redes neuronales

El laboratorio japonés Sakana AI dice haber entrenado redes neuronales de hasta 1.000 capas sin recurrir a la retropropagación, pero quien lo anuncia es la propia empresa en su blog; el estudio que ha publicado se detiene en 128 capas y no ha pasado revisión por pares ni lo ha repetido ningún equipo de fuera. Una red neuronal se entrena midiendo el error al final y devolviéndolo hacia atrás, capa por capa, hasta la primera: eso es la retropropagación, y así se hace desde hace cuarenta años. Prescindir de ella cambiaría lo que hace falta para entrenar, porque es ella la que obliga a guardar en memoria los resultados intermedios de toda la red y a que ninguna capa aprenda hasta que le llega el aviso desde el otro extremo.

Recibe el resumen diario de IA

Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

Frecuencia:

Un entrenador musculoso con camiseta negra en la que se lee sakana.ai grita con un cronómetro en la mano, rodeado de neuronas con brazos y piernas que sudan corriendo en la cinta, remando y levantando pesas.
📷 Imagen generada con IA

En resumen

  • El preprint «Augmented Lagrangian Predictive Coding», de Jeffrey Seely y Julian Gould, salió en arXiv el 29 de mayo de 2026 y solo tiene una versión.
  • Su alcance declarado llega hasta 128 capas, con MNIST y Fashion-MNIST, MLP residuales y una época de entrenamiento.
  • El resultado de las 1.000 capas lo publica la propia empresa en su blog en septiembre de 2026, sin revisión por pares y sin replicación externa.
  • El único número comparable que ofrece Sakana es aproximado: PC-ALM se queda a unos dos puntos porcentuales de la retropropagación en todo el rango de profundidades.
  • La implementación de referencia, en JAX y con licencia MIT, cubre la rejilla del preprint en MNIST y Fashion-MNIST: ni las 1.000 capas, ni CIFAR-10, ni Tiny ImageNet.

Entrenar sin recorrer la red entera hacia atrás

Sakana AI —fundada en 2023 en Tokio por tres antiguos investigadores de Google: Llion Jones, coautor de «Attention Is All You Need», David Ha y Ren Ito— presenta PC-ALM, un método de entrenamiento que prescinde de esa pasada hacia atrás. Según la prensa financiera, su serie B fue de 135 millones de dólares con una valoración posterior de 2.650 millones en noviembre de 2025, y entre sus inversores figuran fondos de capital riesgo estadounidenses como Khosla Ventures y Lux Capital.

La motivación declarada no es competir en rendimiento, sino entender cómo el cerebro asigna crédito a cada neurona sin nada parecido a la retropropagación. Entre las aplicaciones posibles, la empresa menciona el hardware neuromórfico.

Cada capa habla solo con sus vecinas inmediatas

A esa forma de repartir la señal Sakana la llama propagación «balística», frente a la «difusiva» del predictive coding clásico, que según su descripción se apaga antes de alcanzar las primeras capas. Ese es el problema que el método dice resolver: que el aviso llegue hasta el principio de la pila por larga que sea.

Sobre las redes muy profundas, el blog afirma que, «hasta donde sabemos, este es el primer método local por capas del que se ha mostrado que entrena con éxito redes de hasta 1.000 capas». Es una afirmación de la propia empresa, sin replicación externa que la respalde.

El único número comparable sale de un pie de figura

Ni el preprint ni el blog ni el repositorio publican una tabla de precisiones: el preprint trae ecuaciones y un cuadro de coste en notación asintótica, y el blog, mapas de calor y curvas, sin un solo valor escrito. El único dato comparable está al pie de una figura: PC-ALM «se queda dentro de unos 2 puntos porcentuales» de la retropropagación en MNIST a lo largo de todo el rango de profundidades, incluidas las 1.000 capas. Es aproximado, es de los propios autores del método y se refiere al rango entero.

Ese experimento usa un MLP residual de anchura 32, activación ReLU, cinco épocas y un presupuesto de inferencia de dos pasos por capa. La rejilla principal del preprint es otra: anchuras y profundidades de 8, 16, 32, 64 y 128, una sola época y la misma semilla para los tres métodos comparados.

Lo probado en el preprint no es lo que enseña el blog

Qué está en el preprint, qué solo en el blog y qué en el código
Qué se compara Preprint (mayo, arXiv) Blog de la empresa (septiembre) Repositorio
Profundidad máxima 128 capas 1.000 capas La rejilla del preprint
Conjuntos de datos MNIST y Fashion-MNIST Añade CIFAR-10 y Tiny ImageNet MNIST y Fashion-MNIST
Arquitecturas MLP residuales Añade ResNet-18 MLP residuales
Entrenamiento Una época Cinco épocas en el experimento de 1.000 capas
Revisión por pares No: es un preprint No
El repositorio, según su propio README, cubre «la rejilla de anchura y profundidad de MLP residuales del artículo en MNIST y Fashion-MNIST»: ni las 1.000 capas, ni CIFAR-10, ni Tiny ImageNet. El código no reproduce el resultado de las 1.000 capas.

El apartado de limitaciones del preprint lo dice sin rodeos: «los experimentos se restringen a MNIST y Fashion-MNIST, MLP residuales y una época de entrenamiento». Lo que circula como titular del trabajo —las 1.000 capas, y con ellas CIFAR-10, Tiny ImageNet y ResNet-18— está solo en la entrada del blog corporativo, publicada en septiembre de 2026.

Nada de esto invalida el método, y el código publicado permite comprobar la parte revisable: corre en CPU y reproduce la rejilla del preprint. Pero las dos afirmaciones tienen soportes distintos.

Conclusión

Un método que entrene sin retropropagación cambiaría lo que hace falta para entrenar una red: ni guardar los resultados intermedios de toda la pila, ni esperar a que el error vuelva desde el final. PC-ALM apunta en esa dirección con una implementación abierta que cualquiera puede ejecutar, y se queda por debajo de la retropropagación, no por encima. Falta lo de siempre: que el resultado más llamativo pase por una revisión y lo repita alguien de fuera.

Fuentes primarias

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Recibe el resumen diario de IA

    Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

    Frecuencia:

    ← Volver al blog