Aprenent IA

Què és un agent persistent

Un agent persistent és un programa d'IA que rep un encàrrec i continua treballant-hi quan qui l'hi ha manat ja ha tancat l'ordinador. OpenAI va presentar dimarts 29 de setembre de 2026 la seva versió de la idea, els dots: cadascun amb el seu ordinador al núvol, el seu navegador i accés a les aplicacions que l'usuari li connecti. Aquest curs breu ho explica des de zero: què és, què necessita per funcionar, què fa i què no, on és el risc i què costa.

Caricatura d'un taulell de consergeria buit, amb un aparell blanc retolat OpenAI i una ona blava damunt la fusta, un cable que baixa a una capsa negra, un plafó de claus de cotxe penjades al darrere i, rere el vidre de la porta, una mà gegant de vestit que assenyala sobre la ranura per on sobresurten dos papers.
📷 Imatge generada amb IA

En resum

  • Un agent persistent no espera una pregunta: rep un objectiu, el parteix en passos i continua d'una conversa a l'altra, també quan ningú no l'està mirant.
  • OpenAI va presentar dimarts 29 de setembre de 2026, al seu DevDay de San Francisco, els dots: agents d'aquest tipus que funcionen amb GPT-6 Astra i arriben a més de 4.000 aplicacions a través dels permisos que l'usuari ja tenia donats a ChatGPT.
  • Per funcionar necessita quatre coses: un ordinador propi on executar codi, un navegador, les credencials dels comptes on ha d'entrar i una llista escrita del que pot fer sense preguntar.
  • El risc principal el documenta la mateixa companyia: una web, un correu o un document poden portar instruccions amagades que desviïn l'agent. OpenAI afirma que les seves defenses redueixen aquest risc, no que l'eliminin.
  • La porta més barata costa 100 dòlars al mes, i a l'Espai Econòmic Europeu, Suïssa i el Regne Unit no obre; qui es construeixi l'agent amb l'Agents API no paga recàrrec, només els tokens i les eines que gasti.

Un agent persistent és un encàrrec que sobreviu a la conversa

La idea cap en una frase: se li dona un objectiu en lloc d'una pregunta. «Vigila els informes d'errors que vagin entrant, prova els arreglaments i deixa'm els canvis preparats» no és una cosa que es respongui i es tanqui; és una responsabilitat que dura setmanes. Un agent persistent accepta aquest tipus d'encàrrec i torna quan té alguna cosa.

OpenAI va posar nom comercial a aquesta idea dimarts 29 de setembre de 2026, a la seva conferència anual per a desenvolupadors: els dots. Els defineix com a agents sempre actius que funcionen amb GPT-6 Astra —el seu model més capaç i el que millor respecta els límits que li marquen, segons la companyia— i que continuen avançant d'una conversa a la següent.

El que canvia aquí no és la mida del model, és l'embolcall. Al mateix motor que contesta en un xat se li afegeixen un lloc on treballar, unes claus i permís per continuar sense supervisió. D'aquests tres afegits en surten alhora tota la utilitat i tots els problemes que venen després.

El xatbot espera la pregunta; l'agent es queda l'encàrrec

Un xat i un agent persistent, l'un al costat de l'altre
Què es mira Xat al qual preguntes Agent persistent
Quan treballa Mentre esperes la resposta També amb la sessió tancada: continua d'una conversa a l'altra
On s'executa Als servidors del proveïdor, sense un lloc propi on deixar res En un ordinador propi al núvol, amb el seu navegador, on crea fitxers i executa codi
Qui comença Sempre la persona, amb una pregunta També l'agent: busca pel seu compte com ajudar i avisa
Què pot tocar El text de la seva resposta Les aplicacions i els comptes que li hagin connectat
Què reté La conversa en curs i el que el producte guardi com a memòria Context propi que acumula mentre existeixi, inclòs el que llegeix de les aplicacions
Què passa si s'equivoca Una resposta dolenta que es llegeix i es descarta Una acció ja feta: un fitxer canviat, un missatge enviat
La columna de la dreta recull el que OpenAI descriu a la documentació dels dots; la del mig, el funcionament corrent d'un xat.

La diferència pràctica es nota en els errors. Una resposta dolenta d'un xat es llegeix, es descarta i no ha passat res. Un agent que s'equivoca ja ha fet alguna cosa: ha canviat el fitxer equivocat, ha escrit a qui no havia d'escriure o ha compartit el que no tocava.

OpenAI ho diu amb aquestes paraules al seu document de seguretat: els errors d'un agent poden tenir conseqüències més enllà d'una conversa. No és lletra petita, és la raó per la qual tot el producte és ple de confirmacions i de passos que es tornen a la persona.

La segona diferència és qui comença. Un xat no fa res fins que algú escriu. Un dot, segons la companyia, rastreja pel seu compte com pot ajudar mentre ningú no li parla i avisa quan troba alguna cosa; en aquest mode, les seves eines estan limitades a llegir i no poden enviar missatges ni canviar res.

El primer que necessita és un ordinador que sigui seu

Un agent que només escriu text no necessita res. Un que executa codi, baixa fitxers i navega sí que necessita un ordinador, i no pot ser el de l'usuari. En els dots aquest ordinador és al núvol, n'hi ha un per agent, i corre un sistema Linux i un navegador Chrome que manté OpenAI.

La companyia afirma que aïlla els entorns d'uns usuaris dels dels altres i que el codi de l'agent corre separat dels sistemes que coordinen la seva feina i apliquen els controls. En la seva descripció, l'agent pot crear fitxers i executar eines allà, però no fer servir aquest accés per apagar una comprovació obligatòria.

L'ordinador de l'usuari és una altra cosa i comença desconnectat. Connectar-lo és opcional i es fa des de l'aplicació d'escriptori d'aquell equip; a partir d'aquí l'agent arriba als fitxers locals i pot fer servir el navegador de l'ordinador quan el seu està bloquejat. L'accés es revoca des del mateix lloc.

L'ordinador de l'agent es pot obrir i mirar. OpenAI diu que l'usuari s'hi pot abocar en qualsevol moment per veure què hi està fent i fins i tot interactuar amb el que hi ha a la pantalla.

El segon són les claus dels comptes aliens

Per fer alguna cosa útil dins d'un compte cal entrar-hi, i aquí apareix el problema de la contrasenya. Si se li escriu a l'agent dins la conversa, queda dins del seu context, i el que és al context pot acabar sortint en una resposta.

El disseny que descriu OpenAI s'estalvia aquest pas. En els inicis de sessió admesos el model s'atura mentre la persona omple un formulari a part; les credencials van directes al navegador de l'agent sense passar pel context del model, i la feina es reprèn ja dins del compte. Les contrasenyes guardades viatgen per un servei xifrat que les entrega al navegador sense ensenyar-les al model.

La mateixa companyia marca el límit d'aquesta protecció: només cobreix aquests fluxos. Un secret posat a part en un missatge o en un document llegible, escriu, pot continuar sent visible per al model. I hi ha passos que no delega mai: canviar una contrasenya o moure diners entre comptes financers els torna a la persona perquè els acabi ella.

El context de l'agent, afegeix OpenAI, no conserva credencials, imatges ni captures de pantalla. El que sí que pot fer és comprar amb una targeta que ja estigui guardada al web del comerç, i això necessita aprovació.

El tercer són els permisos, i els escriu l'usuari

Les quatre respostes que pot portar una regla pròpia
Opció de la regla Què vol dir
Actuar sense preguntar L'agent fa aquest tipus d'acció pel seu compte
Actuar si està aprovat per endavant Val si l'usuari va demanar aquesta acció de manera explícita en el seu encàrrec
Preguntar abans d'actuar S'atura i espera el vistiplau cada vegada
Tornar-ho a la persona No ho executa: aquest pas l'acaba l'usuari
Noms traduïts de les quatre opcions de l'ajust de regles pròpies, segons el centre d'ajuda d'OpenAI. Una regla pròpia no pot apagar les confirmacions obligatòries, el sistema de revisió ni les restriccions del rastreig en segon pla.

Un agent amb claus i sense regles és una mala idea, així que el producte ve amb regles de sèrie: unes accions les fa sol, d'altres les demana confirmar cada vegada i d'altres les torna. Esborrar dades de manera permanent, instal·lar o executar programari d'origen no reconegut i concedir un accés nou sensible demanen vistiplau sempre, segons OpenAI.

Sobre aquesta base, l'usuari escriu regles pròpies per ajustar què pot fer sense preguntar. L'exemple que posa la companyia és tan simple com «no enviïs mai correus». Aquestes regles, diu, continuen aplicant-se quan l'agent delega feina o treballa en segon pla.

Hi ha un detall fi que convé entendre abans d'autoritzar res: una aprovació val per al que es va aprovar i no s'estira. Aprovar un missatge no dona permís permanent per escriure a la gent, i com més sensible és la dada, més concret ha de ser el destinatari: un historial mèdic exigeix un nom i un cognom; un número de telèfon admet una classe de destinataris, com «qualsevol aerolínia».

Amb això fa el que faria algú assegut al teu ordinador

Per aquesta via els dots arriben a més de 4.000 aplicacions i hereten les connexions que l'usuari ja tenia donades. Se'ls parla des de ChatGPT a l'escriptori, al web i al mòbil, i també des de Slack i Teams, per escrit o per veu.

Els exemples que publica OpenAI són d'oficina i de programació: treure una aplicació d'una API antiga abans que l'apaguin, rastrejar què es trenca quan es canvia, escriure el codi, passar les proves i deixar els canvis a punt perquè algú els revisi. A la presentació del DevDay, la companyia va dir que els seus enginyers tenen els seus dots arreglant desenes d'errors al dia per aquest camí.

També explica casos petits, que fan entendre la idea millor que els grans: el dot d'una persona que el provava abans del llançament es va adonar que el seu propietari no havia facturat a una publicació, va preparar la factura i la va enviar tan bon punt ell la va aprovar. Ningú no li ho havia demanat.

I un advertiment que la mateixa companyia repeteix a l'anunci, al centre d'ajuda i al document de seguretat: els agents s'equivoquen, així que la feina amb conseqüències s'ha de revisar. Algunes accions es poden desfer, com una edició en un document; d'altres, no.

El que encara no pot fer, en la seva pròpia llista

No es crea des del mòbil: cal fer-ho a l'aplicació d'escriptori o a ChatGPT des del navegador d'un ordinador, i al web per a mòbils no funciona. Tampoc no està disponible per a menors de 18 anys.

No té correu propi: se li pot connectar el compte personal de l'usuari, però en el llançament no se li dona una adreça seva. I no truca per iniciativa pròpia, tot i que se'l pot trucar i parlar-hi.

Els missatges de text al telèfon són una beta limitada que corre sobre un proveïdor extern, només per a abonats Pro dels Estats Units, no per a tothom, i exclosa dels espais d'empresa. A Enterprise, Edu i Healthcare el producte sencer és en beta i apagat per defecte fins que l'encén l'administrador de l'espai de treball.

El repartiment, a més, és gradual: tenir el pla no vol dir tenir l'agent aquell mateix dia. OpenAI avisa que pot trigar diversos dies a arribar a un compte.

El risc principal no és que falli: és que li mentin

Un agent que llegeix el web llegeix el que escriuen els altres, i el que escriuen els altres pot anar dirigit a ell. OpenAI ho descriu així al seu centre d'ajuda: una web, un correu o un document poden contenir instruccions que intentin enganyar l'agent perquè faci alguna cosa que el seu propietari no ha demanat, per exemple compartir informació privada.

Les defenses que enumera són quatre, i cap d'elles no és el model tot sol: restriccions sobre el que poden fer les eines, comprovacions automàtiques abans de certes accions, aprovacions obligatòries i vigilància mentre l'agent treballa. Si aquesta vigilància detecta alguna cosa, pot pausar la feina i ensenyar un avís.

La frase que importa ve al darrere: aquestes proteccions ajuden a reduir el risc que unes instruccions malicioses provoquin una acció no desitjada, però no l'eliminen. Ho escriu així, al seu propi centre d'ajuda, la companyia que ven el producte.

A la documentació per a desenvolupadors l'avís encara és més sec. El contingut d'una web es tracta com a no fiable i no pot concedir permisos ni sobreescriure les instruccions de l'usuari; i aprovar un domini no obliga a demanar confirmació per a cada acció que s'hi faci. Qui necessiti aquesta garantia, diu OpenAI, ha de limitar el navegador a llocs on no es pugui comprar ni destruir res.

El que aprèn de tu s'esborra amb ell, no sense ell

Un dot rep la memòria de ChatGPT, crea la seva i es queda amb el que va llegint de les aplicacions connectades, fins i tot sense que ningú li ho hagi preguntat. Apagar la memòria a ChatGPT talla el traspàs, però no esborra el que ja havia passat d'un costat a l'altre.

Desconnectar una aplicació tampoc no esborra res: segons OpenAI, atura l'accés nou i deixa en el context de l'agent el que ja n'havia après. Els records no es poden veure, corregir ni eliminar d'un en un; per buidar aquest context cal esborrar l'agent, i amb ell se'n van les seves converses, els seus records i les seves tasques programades.

Esborrar-lo no s'emporta els fitxers ni les converses que va crear, que es guarden a part. En els espais Business, Enterprise i Edu, la companyia diu que no entrena amb el contingut del client per defecte; en els plans personals això depèn d'un ajust. I encara amb l'ajust apagat, admet que hi pot haver revisió humana en casos limitats, com els de seguretat.

El preu d'entrada són 100 dòlars al mes

Les vies per tenir un agent persistent d'OpenAI i el que costa cadascuna
Via Preu publicat al mes Què porta Què es mesura a part
ChatGPT Pro, pla personal 100, 200 o 500 dòlars segons l'escaló El primer agent inclòs sense cost addicional, excepte a l'Espai Econòmic Europeu, Suïssa i el Regne Unit, on no es reparteix Parlar amb ell no gasta quota de ChatGPT; el que se li encarregui a Codex o a ChatGPT Work, sí
ChatGPT Business, seient premium 100 dòlars amb pagament anual; 125 pagant mes a mes El primer agent inclòs, a totes les regions on ChatGPT està disponible Igual que a Pro: la conversa no compta, les tasques a Codex i a ChatGPT Work sí
ChatGPT Business, seient estàndard 20 dòlars amb pagament anual; 25 pagant mes a mes No inclou agent No s'aplica
Enterprise, Edu i Healthcare Sense tarifa pública: es negocia amb l'equip de vendes Beta apagada per defecte fins que l'encén l'administrador Sense quota publicada
Un segon agent, o més velocitat per al primer OpenAI no ha publicat tarifa Anunciat per al futur, sense data No s'aplica
Construir-se'n un amb l'Agents API Sense recàrrec per fer servir la interfície La mateixa infraestructura amb què OpenAI mou Codex; continua en beta pública Els tokens i les eines que gasti l'agent
Tarifes publicades per OpenAI i consultades l'1 d'octubre de 2026. La companyia afegeix que el primer mes després del llançament els límits d'ús de l'agent van ampliats.

La porta més barata per a un particular són els 100 dòlars al mes de l'escaló baix del pla Pro de ChatGPT, amb una excepció grossa per a qui llegeixi això des d'Espanya: a l'Espai Econòmic Europeu, Suïssa i el Regne Unit, Pro no reparteix dots. Per aquí l'única via és un seient premium de ChatGPT Business, que costa 100 dòlars al mes amb pagament anual i 125 pagant mes a mes, i que sí que els dona a totes les regions admeses.

El que va a dins és un agent, el primer, sense cost addicional. Parlar amb ell no consumeix la quota de ChatGPT; les tasques que se li manin a Codex o a ChatGPT Work es descompten com sempre. El pla porta, a més, una quota per al treball en profunditat, amb límits ampliats durant el primer mes després del llançament.

El que no té preu és gairebé tota la resta. OpenAI anuncia que més endavant es podran afegir més agents i apujar-li a un la velocitat o la quantitat de feina que accepta al mes, però no ha publicat tarifa per a cap de les dues coses ni data per a cap d'elles. Enterprise, Edu i Healthcare passen per l'equip de vendes, amb preu a convenir.

Queda la via de qui programa: muntar-se l'agent persistent amb l'Agents API, que és la mateixa maquinària amb què OpenAI mou Codex. Fer-la servir no porta recàrrec; es paguen els tokens i les eines que l'agent consumeixi. I aquí el cost ja no és una quota mensual, sinó un comptador que corre mentre l'agent treballa.

Conclusió

Un agent persistent no és un xat més llest: és un xat amb un ordinador, unes claus i permís per continuar sense tu. Això és justament el que el fa útil i el que fa que els seus errors arribin ja comesos. Abans de donar-li les claus de res, val la pena llegir dues coses a la documentació de qui el ven: quins passos torna sempre a la persona i què diu sobre les instruccions amagades. La segona resposta, avui, és que el risc es redueix i no s'elimina.

Fonts primàries

Comentaris

Sigues respectuós. Els comentaris es moderen.

    La continuació natural

    Aprèn IA al teu ritme amb els nostres cursos gratuïts.

    A la nostra plataforma d'aprenentatge TAKU podràs accedir a aquest i a molts altres cursos de manera totalment gratuïta.

    APRENDRE AMB TAKU

    ← Torna al blog