Robòtica

AXIS porta la recollida de dades de robòtica al navegador: 207 tasques i 50.129 trajectòries

L'escassetat de dades és el coll d'ampolla real de la robòtica moderna: els models creixen molt més de pressa que els conjunts de demostracions amb què s'entrenen. AXIS proposa trencar aquesta dependència del maquinari de laboratori traslladant la teleoperació a un navegador web i deixant el còmput pesant en GPU de servidor. El resultat és un motor de dades amb 207 tasques de manipulació i 50.129 trajectòries verificades.

Rep el resum diari d'IA

Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

Freqüència:

AXIS porta la recollida de dades de robòtica al navegador: 207 tasques i 50.129 trajectòries
📷 MarkTechPost — cobertura de AXIS (arXiv:2607.21588) · fuente

En resum

  • AXIS aplega 207 tasques de manipulació robòtica i 50.129 trajectòries verificades amb el braç Franka.
  • La recollida de demostracions es fa des d'un navegador web, sense necessitat d'accés físic a un robot.
  • El preentrenament continuat amb aquestes dades eleva el model pi0.5 de 83,9 a 88,8 punts en LIBERO-Plus.
  • Un control amb el mateix volum de dades procedents de RoboCasa365 es queda en 57,5 punts, cosa que suggereix que la qualitat importa més que la mida bruta.

El coll d'ampolla de la robòtica no són els models, són les dades

En visió i llenguatge, l'escalat es va resoldre amb corpus massius extrets d'internet. En manipulació robòtica no existeix aquesta drecera: cada trajectòria exigeix un braç real, un operador humà i temps de laboratori. Aquesta restricció física explica per què els conjunts de dades de robòtica encara es mesuren en desenes de milers d'episodis quan els models de llenguatge s'entrenen amb bilions de tokens (unitats mínimes de text).

L'enfocament d'AXIS consisteix a desacoblar l'operador del maquinari. La interfície de teleoperació viu en el navegador i tota la feina costosa (simulació, renderitzat, verificació) s'executa en GPU de backend (rerefons de servidor). Qualsevol persona amb connexió pot aportar demostracions, cosa que converteix la recollida de dades en un problema d'escala web i no de logística de laboratori.

Les xifres apunten que la composició del conjunt pesa més que no pas la mida

La dada més interessant no és el volum, sinó la comparació controlada. En aplicar continual pretraining (preentrenament continuat) sobre pi0.5, un model de tipus VLA (Vision-Language-Action, visió-llenguatge-acció), la puntuació en el benchmark (prova de rendiment) LIBERO-Plus puja de 83,9 a 88,8. Un experiment de control amb el mateix volum de dades preses de RoboCasa365 arriba només a 57,5.

Aquesta diferència és l'argument central: si dos conjunts de la mateixa mida produeixen resultats tan dispars, la variable determinant és la diversitat de tasques i la verificació de les trajectòries, no la quantitat. LIBERO-Plus és una variant endurida del banc de proves LIBERO, dissenyada precisament per a penalitzar els models que memoritzen escenes en lloc de generalitzar.

El model de dades obertes comença a arribar a la manipulació

La robòtica fa anys que intenta replicar l'efecte ImageNet amb iniciatives com Open X-Embodiment o DROID, que agreguen dades de múltiples laboratoris. L'aportació diferencial d'un motor basat en navegador és que no depèn que existeixin laboratoris amb robots disponibles: amplia l'embut de contribuïdors potencials de centenars a milions.

Queda la pregunta incòmoda de sempre en simulació: quant del que s'ha après sobreviu al salt sim-to-real (de la simulació al món real). Les millores reportades es mesuren en entorns simulats, i la transferència a un braç Franka físic en una cuina real continua sent l'examen que cap conjunt de dades no ha aprovat encara amb escreix.

Conclusió

Si el patró es confirma, AXIS assenyala un canvi de mentalitat: deixar de tractar les dades de robòtica com un subproducte artesanal del laboratori i començar a dissenyar-les com a infraestructura, amb criteris explícits de diversitat i verificació. La diferència de 31 punts respecte d'un conjunt de volum equivalent és un recordatori que en manipulació no guanya qui acumula més episodis, sinó qui acumula els episodis adequats. La fita següent, i l'única que importa de debò, serà veure aquests guanys replicats sobre maquinari físic i no només en el simulador.

Fonts primàries

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Rep el resum diari d'IA

    Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

    Freqüència:

    ← Torna al blog