Robòtica

Skild AI presenta S1, un robot que imita tasques vistes una sola vegada

Skild AI ha presentat S1, un nou foundation model (model fundacional) per a robots capaç de reproduir una tasca després de veure una única demostració en vídeo, sense entrenament addicional. El sistema aborda tasques inèdites de fins a deu minuts compostes per desenes de passos, des de trasplantar una planta fins a preparar cafè de filtre. És un intent de traslladar a la robòtica la lògica del prompting (instrucció en llenguatge natural) que ja domina el programari.

Rep el resum diari d'IA

Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

Freqüència:

Skild AI presenta S1, un robot que imita tasques vistes una sola vegada
📷 Skild AI · fuente

En resum

  • Skild AI ha llançat S1, el seu foundation model (model fundacional) per a robots.
  • N'hi ha prou amb una sola demostració en vídeo perquè el robot executi una tasca que mai no ha vist, amb zero fine-tuning (ajust fi) i sense entrenament addicional.
  • S1 gestiona tasques noves de fins a 10 minuts de durada amb desenes de passos individuals encadenats.
  • Entre les demostracions: trasplantar una planta, preparar cafè de filtre per degoteig, assemblar kits i cuinar i girar una crep.

Què ha passat

Skild AI ha presentat S1, un foundation model (model fundacional) dissenyat específicament per a robots. La proposta trenca amb l'enfocament habitual del sector: en lloc de programar cada tasca o entrenar una política de control específica per a cada cas, al robot se li mostra un únic vídeo de demostració d'una tasca que mai no ha vist i aquest la reprodueix pel seu compte.

El punt clau és que aquesta reproducció es produeix sense fine-tuning (ajust fi), és a dir, sense reentrenar ni retocar els pesos del model amb dades noves d'aquesta tasca concreta, i sense cap entrenament addicional. La demostració funciona com una instrucció, no com a material d'aprenentatge que s'hagi de processar prèviament.

Segons les dades difoses per la companyia, S1 és capaç d'afrontar tasques completament noves de fins a deu minuts de durada, compostes per desenes de passos individuals. Entre les demostracions mostrades hi figuren trasplantar una planta a una altra torreta, preparar cafè de filtre per degoteig, assemblar kits i cuinar una crep girant-la, tot això després d'haver vist una sola execució.

Per què importa

La durada és una dada més rellevant del que sembla. Deu minuts i desenes de passos encadenats suposen un horitzó temporal llarg per a un sistema robòtic: implica mantenir el context de la tasca, encadenar subobjectius i recuperar-se de petites desviacions sense que l'error s'acumuli fins a arruïnar el resultat. La majoria de les demostracions habituals en robòtica es mouen en el terreny d'accions curtes i molt acotades, com ara agafar i col·locar un objecte.

El segon element diferencial és el cost d'ensenyar alguna cosa nova. Si cada tasca exigeix recopilar dades, entrenar i validar, la robòtica queda confinada a entorns industrials d'alt volum on aquest esforç s'amortitza. Si n'hi ha prou amb enregistrar una demostració, la barrera baixa dràsticament i s'obre la porta a escenaris variables: cuines, tallers, magatzems petits, tasques domèstiques.

Skild AI planteja S1 explícitament com un intent de portar a la robòtica la idea del prompting (instrucció en llenguatge natural), el mecanisme que van popularitzar els LLM o large language models (models de llenguatge grans) i que permet demanar a un sistema que faci alguna cosa nova sense tocar-ne l'entrenament. Aquí el prompt no és text, sinó un vídeo.

Context

La noció de foundation model es va consolidar primer en l'àmbit del llenguatge i la visió: models grans entrenats amb dades massives i genèriques que després serveixen de base per a multitud d'aplicacions. Traslladar aquest esquema al món físic és un dels objectius declarats del sector robòtic, perquè un model generalista evitaria reconstruir des de zero el programari de cada robot i cada aplicació.

L'obstacle clàssic ha estat la generalització. Un robot que domina una tasca en un laboratori sol fallar quan canvien la il·luminació, la posició dels objectes o el mateix objecte. Un sistema que aprèn d'una única demostració s'enfronta a aquest problema en la seva versió més exigent, perquè no disposa de repeticions ni de dades de reforç sobre les quals corregir-se.

Què cal vigilar

Les incògnites rellevants són les de sempre en robòtica: la taxa d'èxit real fora de les condicions de demostració, el comportament davant d'objectes i entorns no vistos, i què passa quan la tasca es torça a mig camí. Skild AI no ha fet públiques, ara per ara, dades que permetin respondre aquestes preguntes amb detall.

També queda per concretar en quines plataformes físiques funciona S1 i en quines condicions estarà disponible per a tercers. La utilitat pràctica d'un foundation model robòtic depèn que es pugui desplegar en maquinari diferent del que es va utilitzar per a les demostracions.

Conclusió

S1 encaixa en una tendència clara: la robòtica està migrant del paradigma de programar comportaments al d'instruir-los, amb el vídeo com a interfície. El que crida l'atenció de l'anunci de Skild AI no és que un robot prepari cafè o trasplanti una planta, sinó que ho faci després d'una sola demostració i sostenint una seqüència de deu minuts sense reentrenament. Si aquestes xifres es mantenen fora de l'entorn controlat d'una demostració, el coll d'ampolla de la robòtica deixaria de ser el programari específic de cada tasca i passaria a ser la fiabilitat mecànica i la seguretat operativa. Fins que no hi hagi avaluacions independents i dades de rendiment en condicions reals, convé llegir l'anunci com un senyal de direcció del sector més que no pas com un producte tancat.

Fonts primàries

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Rep el resum diari d'IA

    Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

    Freqüència:

    ← Torna al blog