Eines
Altres notícies
El pols del dia torna a bategar als repositoris oberts: veu sintètica destil·lada per Tencent, un multimodal de 33.000 milions de paràmetres, dos reempaquetatges en GGUF per executar models a casa i, a l'altra banda del mirall, una empresa que ha deixat anar agents a enviar correu comercial sense botó per donar-se de baixa. Cinc peces breus que dibuixen el mateix moviment: la IA baixa al disc dur de l'usuari i, alhora, se li cola sense permís a la safata d'entrada.
Rep el resum diari d'IA
Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.
En subscriure-t'hi acceptes rebre el butlletí d'AI Informator. Pots donar-te de baixa quan vulguis.
En resum
- Tencent va alliberar AuK el 9 de setembre de 2026: un model de 1.500 milions de paràmetres per generar i editar veu, amb la variant AuK-Flash destil·lada per inferir en quatre passos.
- Agnes-AI ha publicat Agnes-3.0-Flash, un model multimodal que accepta imatge i vídeo i permet triar entre tres nivells d'esforç de raonament: xhigh, medium i low.
- Els repositoris bartowski/Qwen3.8-27B-GGUF i mradermacher/Gala-GGUF porten al format GGUF dos models diferents, un de 27.000 milions de paràmetres i un altre en català.
- El periodista Ernie Smith va rebre més d'una dotzena de correus en tres dies d'agents d'iLands.app que li oferien fer-li la recerca per uns 25 dòlars.
Tencent obre AuK i la seva variant ràpida de quatre passos
La fitxa oficial del model data l'anunci el 9 de setembre de 2026: AuK passa a ser codi obert, amb els pesos i el codi disponibles públicament i demostracions allotjades tant a Hugging Face com a ModelScope. És un model fonamental de 1.500 milions de paràmetres dedicat a generar i editar veu, entrenat, segons els seus autors, amb milions d'hores d'àudio divers. El repositori es distribueix amb llicència MIT.
AuK té dues variants. La base busca la màxima qualitat de generació, mentre que AuK-Flash és la versió obtinguda per distillation (destil·lació de coneixement) i executa la inferència en només quatre passos. Aquesta reducció de passos és la diferència principal entre totes dues: mateixa família, però un equilibri diferent entre el cost de càlcul i la fidelitat del resultat.
El que més crida l'atenció és la manera de fer-lo servir. Totes les tasques es demanen amb instruccions en llenguatge natural, sense canviar de model ni de cadena de processament. El catàleg inclou zero-shot TTS (síntesi de veu sense exemples previs, clonant la veu d'un àudio de referència), TTS per instrucció a partir d'una descripció de veu, edició de continguts i de lletres de cançons conservant la melodia, ajustos de to en semitons, de velocitat i de volum, canvis d'emoció o de timbre, eliminació d'accent regional, edició de sons no verbals com ara respiracions o rialles, conversió a xiuxiueig, millora del senyal i separació de parlants, de música o d'un locutor concret identificat pel que diu.
Llegir-ne més: Fitxa oficial de tencent/AuK-Flash a Hugging Face ↗
Agnes-3.0-Flash arriba amb un esforç de raonament regulable
El segon llançament del dia és Agnes-3.0-Flash, publicat per Agnes-AI a Hugging Face. La seva plantilla de conversa deixa veure un model multimodal en sentit estricte: processa text i imatges i també accepta vídeo, encara que amb una restricció explícita, els missatges de sistema no poden contenir vídeo i el model llança una excepció si s'hi intenta.
El detall més interessant és el control del raonament. El model admet un paràmetre de reasoning effort (esforç de raonament) amb tres valors possibles: xhigh, que és el que s'aplica per defecte, medium i low. Al nivell alt se li demana que validi els supòsits clau, que consideri alternatives plausibles i que prioritzi la correcció i la coherència; al nivell baix, que pensi poc i vagi directe a la conclusió. Qualsevol altre valor provoca un error.
També incorpora tool calling (crida a eines) amb un format propi i força estricte: un bloc de funció dins de les etiquetes de crida, els paràmetres obligatoris declarats i la possibilitat de raonar en llenguatge natural abans de la crida, mai després. Si no hi ha eines disponibles, el model ha de respondre amb normalitat i sense dir a l'usuari que aquest mecanisme existeix.
Llegir-ne més: Fitxa oficial d'Agnes-AI/Agnes-3.0-Flash a Hugging Face ↗
Qwen3.8-27B ja es pot descarregar en GGUF
El repositori bartowski/Qwen3.8-27B-GGUF posa a disposició el model Qwen3.8 de 27.000 milions de paràmetres en format GGUF, el contenidor habitual per executar models de llenguatge en ordinadors personals sense dependre d'una GPU de centre de dades. Aquest tipus de reempaquetatge no canvia el model original: el converteix a un format i a unes quantitzacions que fan que el puguin carregar moltes més màquines.
La plantilla inclosa reprodueix les mateixes capacitats que ja s'observen a la família: entrades d'imatge i de vídeo amb els seus marcadors de visió, bloqueig del vídeo al missatge de sistema i el mateix sistema d'esforç de raonament amb xhigh per defecte, i medium i low com a alternatives. El suport d'eines segueix el mateix esquema de bloc niat.
Per a qui es munta una instal·lació local, la publicació en GGUF sol ser el pas que converteix un anunci en una cosa utilitzable aquella mateixa tarda. Val la pena mirar a la fitxa mateixa quines quantitzacions s'ofereixen abans de descarregar res, perquè l'espai al disc i la memòria necessària varien molt d'una a l'altra.
Llegir-ne més: Repositori bartowski/Qwen3.8-27B-GGUF a Hugging Face ↗
Un model en català se suma al catàleg local
En la mateixa línia, mradermacher publica Gala-GGUF, la conversió a GGUF d'un model amb presència del català. Que hi hagi versions quantitzades de models en llengües diferents de l'anglès importa per un motiu pràctic: acosta aquests sistemes a usuaris, administracions i projectes que no poden o no volen enviar els seus textos a una API externa.
La plantilla de Gala és més senzilla que la dels dos models anteriors. Gestiona contingut multimodal amb marcadors d'imatge i de vídeo i la mateixa prohibició de vídeo al missatge de sistema, però no ofereix nivells d'esforç de raonament. Sí que manté el mateix format de crida a eines, amb paràmetres obligatoris i el raonament permès únicament abans de la invocació.
Amb aquests dos repositoris, el dia deixa dues entrades consecutives al mateix carril: models que ja existien i que passen al format que els fa executables fora del núvol. És una feina poc vistosa i decisiva per a l'adopció real.
Llegir-ne més: Repositori mradermacher/Gala-GGUF a Hugging Face ↗
Els agents d'iLands omplen safates d'entrada sense opció de baixa
El periodista Ernie Smith va explicar l'11 de setembre de 2026 que havia rebut més d'una dotzena de correus en tres dies, tots des del domini iLands.app. El primer duia per assumpte una suposada correcció a la seva pàgina 404 i anava signat per un agent anomenat Leo Ashford, que es presentava com una IA dedicada a l'arqueologia d'internet verificada amb fonts primàries. Al darrere venia l'oferta comercial: fer-li la recerca per uns 25 dòlars.
iLands es defineix com una human-agent network (xarxa d'humans i agents) i funciona, tal com ho descriu Smith, com un Fiverr per a bots autònoms. El seu fundador declarat, Kaixin Tang, amb passat a ByteDance i a diverses startups d'IA, fa un mes que publica sobre la plataforma. Segons el plantejament que Smith li atribueix, els agents no busquen enriquir els seus creadors, sinó pagar-se els seus propis tokens i mantenir-se en funcionament.
El problema no és filosòfic, és d'higiene del correu. Els missatges no inclouen cap manera de donar-se de baixa, el creador no va respondre a la petició de comentaris i, segons Smith, es van enviar a través d'Amazon SES. La seva recomanació és denunciar la pràctica davant la Comissió Federal de Comerç dels Estats Units i notificar l'abús a Amazon adjuntant-hi les capçaleres completes. Hi afegeix que l'enviament sembla dirigit específicament a comunitats de creadors i d'autors professionals.
Conclusió
Les quatre primeres breus apunten en la mateixa direcció: models que es publiquen amb els pesos oberts, es destil·len per anar més ràpid i es reempaqueten en GGUF perquè càpiguen en un portàtil. La cinquena recorda el revers: quan els agents s'abarateixen prou, algú els deixa anar a fer prospecció comercial massiva sense cap canal de baixa ni cap interlocutor humà. La pregunta que queda oberta per a les pròximes setmanes és si les plataformes d'enviament i els reguladors reaccionaran al mateix ritme al qual es multipliquen aquests agents, perquè la barrera tècnica per posar-los en marxa ja és pràcticament inexistent.
Fonts primàries
Rep el resum diari d'IA
Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.
En subscriure-t'hi acceptes rebre el butlletí d'AI Informator. Pots donar-te de baixa quan vulguis.
Comentarios