Altres notícies

Altres notícies

Vuit avenços que no han arribat a portada però marquen el pols del dia: radar que reconstrueix la profunditat d'una escena quan la vista falla, un model de llenguatge que aprèn a predir conceptes i no només paraules, transcripció d'una veu concreta enmig del soroll, memòria cau per significat per abaratir les crides als models, càlcul biomolecular accelerat en GPU, l'arribada de Gemini a Windows, una estació de treball Linux amb 192 GB de memòria gràfica i el pont entre Ollama i l'aplicació d'escriptori de ChatGPT. Tot apunta al mateix lloc: fer més amb els mateixos watts, els mateixos tokens i el mateix maquinari.

Rep el resum diari d'IA

Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

Freqüència:

En resum

  • GRADE calcula la distància a cada punt de l'escena amb un sol fotograma de radar d'ones mil·limètriques: 0,303 m d'error mitjà en escenes netes i 0,313 m amb fum real.
  • NCP-ArchPreview, de 8.900 milions de paràmetres, iguala la pèrdua final d'OLMo-3-7B amb només el 51,3 % dels tokens d'entrenament.
  • Xiaomi-CocktailASR-1 transcriu un parlant concret sense separar abans les veus i retorna text buit si aquesta persona no surt a l'enregistrament.
  • Redis LangCache assegura que retalla fins a un 90 % el cost de les crides als models i serveix els encerts de memòria cau fins a 15 vegades més ràpid.
  • BioIR, d'NVIDIA, multiplica per 2,90 el rendiment de plegament de Boltz-2: 58.500 residus per hora de GPU en 8 H100.
  • Google llança l'aplicació de Gemini per a Windows.
  • System76 presenta el Thelio Mira AI, una estació de treball Linux amb 192 GB de memòria de GPU.
  • Ollama 0.34 permet apuntar l'aplicació d'escriptori de ChatGPT cap a models oberts, al núvol o al mateix ordinador.

GRADE reconstrueix la profunditat d'una escena amb un sol fotograma de radar

Reconstrucció de la profunditat d'una escena amb un sol fotograma de radar mitjançant GRADE
📷 Zhao, Chiou y Garg / GRADE · CC BY-NC-SA 4.0 · fuente

La percepció de l'espai en tres dimensions falla justament quan més falta fa. El fum, la boira i la foscor encegen els sensors òptics perquè les partícules en suspensió impedeixen que la llum torni, i un bomber o un robot de rescat es queden sense mapa del terreny que trepitgen. El radar d'ones mil·limètriques sí que aguanta aquestes condicions i mesura distàncies amb precisió, però té una antena petita i per això distingeix molt malament de quina direcció ve cada eco: sap a quina distància hi ha alguna cosa, no pas quina forma té.

GRADE corregeix aquest desequilibri amb un model generatiu ja entrenat que es basa en la geometria que aporta el radar. Primer converteix els senyals crus del radar 4D en una estimació aproximada de la distància a cada punt. Després, un model de difusió reconstrueix el detall de les formes: a cada pas de neteja de soroll fa servir aquella primera estimació com a guia. Un mòdul addicional aprofita el poc que encara veu la càmera quan queda alguna cosa visible, i el conjunt s'entrena amb imatges netes, amb fum i amb obstacles al davant, de manera que el sistema es basa cada cop més en el radar a mesura que empitjora la visibilitat.

Les xifres surten d'uns 95.000 fotogrames enregistrats en dotze edificis amb fum real, no simulat. GRADE s'equivoca de mitjana en 0,303 metres amb l'escena clara i en 0,313 metres amb fum, millor que els sistemes de referència que hi ha. Aquest centímetre escàs de diferència entre el fàcil i el difícil és la troballa de debò: el rendiment gairebé no se'n ressent. El codi i els conjunts de dades són publicats.

Llegir-ne més: arXiv ↗

NCP-ArchPreview aprèn a predir conceptes, no només la paraula següent

Esquema d'NCP-ArchPreview, que prediu conceptes a més de la paraula següent
📷 The Intern-NCP Team / Shanghai AI Lab y LUMIA Lab · fuente

Un model de llenguatge convencional s'entrena per encertar la paraula següent. NCP-ArchPreview hi afegeix un objectiu més ambiciós: predir conceptes, unitats de significat que abracen diverses paraules alhora. Per aconseguir-ho es fabrica el seu propi vocabulari de conceptes a partir dels estats interns, amb una tècnica de compressió anomenada quantització per producte, i un mòdul específic aprèn a anticipar quins conceptes venen després. Aquestes prediccions tornen al nivell de la paraula per orientar la generació, i els dos objectius s'entrenen alhora.

La demostració ha escalat fins a 8.900 milions de paràmetres i 5,73 bilions de tokens del conjunt Dolma-3, cosa que els autors descriuen com el model de llenguatge en espai latent més gran construït fins ara. El resultat més cridaner és d'eficiència: amb tot just el 51,3 % dels tokens totals, el model ja iguala la pèrdua final de preentrenament d'OLMo-3-7B. Quan acaba l'entrenament, el supera en 2,45 punts en la mitjana de tasques posteriors i en guanya 5,99 a GSM8K, el banc de proves de problemes matemàtics.

Els experiments controlats separen què hi aporta l'arquitectura latent i què l'objectiu conceptual, i tots dos milloren de manera clara. Amb només el 85 % del còmput habitual, el model gairebé arriba a la pèrdua d'una referència de 8.900 milions de paràmetres dimensionada exactament igual. L'espai latent continua rendint després: n'hi ha prou d'actualitzar el mòdul de quantització, de 17 milions de paràmetres, per adaptar el model a un domini nou sense tocar la resta, i injectar les representacions conceptuals en un esborrany DFlash2 allarga un 4,17 % el text acceptat de mitjana, amb un cost afegit insignificant.

Llegir-ne més: arXiv ↗

Xiaomi-CocktailASR-1 transcriu una sola veu enmig del garbuix

Xiaomi-CocktailASR-1 davant el problema de transcriure una veu entre diverses de superposades
📷 Zhang et al. / Xiaomi-CocktailASR-1 · CC BY 4.0 · fuente

El reconeixement de la parla basat en grans models de llenguatge ha avançat molt, gairebé sempre donant per fet que hi parla una sola persona. Tan bon punt diverses veus es trepitgen —el clàssic problema de la festa de còctel— la precisió se'n va en orris. Els sistemes actuals que miren de seguir un parlant concret, tant si fan servir arquitectures d'extrem a extrem amb empremtes vocals com els assajos més recents amb models de llenguatge, arrosseguen dos defectes: empitjoren quan només hi parla una persona i no saben callar quan la veu que busquen no hi és.

Xiaomi-CocktailASR-1 proposa una única arquitectura d'extrem a extrem que rep una mostra de referència com a empremta vocal, a manera d'instrucció. Amb això transcriu directament el que diu aquella persona, sense separar abans les veus en pistes diferents. El sistema continua rendint bé quan només hi parla un, al nivell dels models de reconeixement convencionals, i sap descartar: si la veu buscada no surt a l'enregistrament, retorna text buit.

El model inclou a més un mode de raonament pas a pas que mostra com arriba a cada decisió. En proves àmplies sobre enregistraments amb diversos parlants, tant sintètics com reals, els autors declaren resultats a l'altura de l'estat de l'art, amb un equilibri entre precisió amb diverses veus, precisió amb una de sola i capacitat d'abstenir-se que fins ara demanava combinar sistemes diferents.

Llegir-ne més: arXiv ↗

Redis llança LangCache, una memòria cau per significat per abaratir la inferència

Redis LangCache, servei gestionat de memòria cau per significat per reduir el cost de la inferència
📷 Redis · visual oficial de LangCache · fuente

Les aplicacions que fan servir models de llenguatge en producció gairebé mai no reben una pregunta realment inèdita. Els assistents de suport i els sistemes de recuperació augmentada atenen les mateixes intencions milers de vegades al dia, formulades de mil maneres, i la majoria d'arquitectures tracten cada variant com una petició nova que es factura sencera. El malbaratament ve de fàbrica: es paga un cop i un altre per generar la mateixa resposta amb altres paraules.

Redis LangCache és un servei gestionat que es col·loca entre l'aplicació i el model i desa les respostes ja donades. En comptes de comparar textos idèntics, mira si dues preguntes volen dir el mateix, de manera que encerta encara que la redacció canviï del tot. Com que ve gestionat, estalvia a cada equip haver de construir i mantenir la seva pròpia capa de representacions vectorials, llindars de semblança i caducitat de la memòria cau.

Les xifres del llançament parlen de retallar fins a un 90 % el cost de les crides a la interfície del model i de servir els encerts de memòria cau fins a quinze vegades més ràpid. Val més llegir-les com un sostre, no com una mitjana: l'estalvi real depèn de quanta repetició hi hagi al trànsit i de fins a quin punt el cas d'ús tolera una resposta generada temps enrere.

Llegir-ne més: MarkTechPost ↗

BioIR multiplica per 2,90 el plegament de proteïnes de Boltz-2

BioIR, d'NVIDIA, accelera 2,90 vegades el plegament de proteïnes de Boltz-2
📷 NVIDIA · BioNeMo Inference Runtime · fuente

NVIDIA ha detallat BioNeMo Inference Runtime, o BioIR, una biblioteca de Python que accelera a les seves GPU els models que prediuen l'estructura de molècules biològiques, sense sortir de PyTorch. Aquesta condició pesa més del que sembla: quedar-se dins de PyTorch evita que els laboratoris hagin de reescriure els seus processos o migrar a un altre format de desplegament només per guanyar velocitat.

L'acceleració actua en tres fronts. El primer, nuclis de còmput escrits a mida. El segon, la captura mitjançant CUDA Graph, que retalla el cost de llançar una vegada i una altra les mateixes operacions. El tercer, un repartiment per rèpliques gestionat amb Ray que instal·la una còpia sencera del model a cada GPU. En una comparació en igualtat de condicions sobre 1.000 dímers humans amb vuit H100, Boltz-2 accelerat amb BioIR va plegar 58.500 residus per hora de GPU, davant dels 20.200 d'una implementació oberta compilada amb torch: 2,90 vegades més.

Aquest rendiment ja ha donat fruit científic. Segons NVIDIA, BioIR va ser el motor de l'ampliació de la base de dades d'AlphaFold, amb uns 31 milions de complexos proteics candidats generats al llarg de 4.777 proteomes. És la mena de salt que converteix un cribratge computacional inabastable en una feina de dies.

Llegir-ne més: MarkTechPost ↗

Google llança l'aplicació de Gemini per a Windows

L'aplicació de Gemini, ja disponible per a Windows
📷 Google · Gemini para ordenadores · fuente

Google ha anunciat que l'aplicació de Gemini ja es pot fer servir a Windows. Amb això el seu assistent completa la presència a l'escriptori més utilitzat del món i els usuaris poden recórrer a la intel·ligència artificial de Google sense passar pel navegador.

Una aplicació nativa es nota en detalls de cada dia: dreceres de teclat que funcionen des de qualsevol programa, integració amb les finestres del sistema i la possibilitat d'invocar-la sense tenir cap pestanya oberta.

La batalla per l'assistent d'escriptori es juga en els segons que costa començar, i posar una icona pròpia a Windows va exactament d'això: escurçar la distància entre el dubte i la pregunta al model. El desplegament oficial va arrencar el 10 de setembre.

Llegir-ne més: Google ↗

System76 presenta el Thelio Mira AI, una estació Linux amb 192 GB de memòria de GPU

Thelio Mira AI, l'estació de treball Linux de System76 amb 192 GB de memòria de GPU
📷 System76 · Thelio Mira AI · fuente

System76 ha presentat el Thelio Mira AI, una estació de treball Linux construïda al voltant d'una xifra: 192 GB de memòria de GPU. Aquest número decideix què es pot fer al mateix ordinador i què no, perquè el límit per executar o afinar un model gran gairebé mai no és la potència de càlcul, sinó quants paràmetres hi caben sense trossejar la feina.

Amb aquest marge hi caben a la memòria models que en una targeta de consum obliguen a retallar precisió de manera dràstica, a repartir capes entre diverses targetes o a descarregar pesos a la memòria del sistema, amb la pèrdua de velocitat que això comporta. També permet ajustar models amb textos molt llargs i processar més peticions alhora sense jocs de mans a la configuració.

El posicionament és clar: una alternativa de sobretaula per a equips que prefereixen no llogar còmput al núvol, sigui pel cost recurrent, per la confidencialitat de les dades o simplement per tenir el maquinari a mà. Que vingui amb Linux instal·lat de fàbrica estalvia, a més, el mal de cap habitual dels controladors i els entorns de càlcul.

Llegir-ne més: System76 ↗

Ollama 0.34 connecta l'aplicació d'escriptori de ChatGPT amb models oberts

Ollama 0.34 connectant l'aplicació d'escriptori de ChatGPT amb models oberts
📷 Ollama · notas oficiales de v0.34.0 · fuente

Ollama 0.34 permet configurar l'aplicació d'escriptori de ChatGPT perquè respongui amb models servits per Ollama. A macOS el procediment consisteix a obrir Ollama, activar l'opció de ChatGPT, deixar que el mateix Ollama configuri i engegui l'aplicació i triar després un model obert al selector.

Entre els models recomanats hi ha GLM-5.3-Flash, DeepSeek-V4 i Kimi-K3. Per a tasques delicades, Ollama suggereix models que s'executen sencers al mateix ordinador, com ara Gemma 4 i Qwen 3.8. Es poden fixar fins a cinc models als ajustos i combinar els del núvol amb els locals segons el tipus de consulta.

La companyia sosté que la cerca web, els complements i el control de l'ordinador continuen funcionant sense ajustos addicionals, i esmenta compatibilitat amb extensions com Notion, Granola, GitHub i Google Calendar. Si es compleix, l'atractiu és evident: mantenir la interfície d'escriptori a la qual molts ja s'han acostumat i decidir a part quin model contesta.

Llegir-ne més: Ollama ↗

Conclusió

El dia no deixa cap gran titular, sinó una suma de millores en la mateixa direcció: gastar menys per aconseguir el mateix o més. GRADE treu profunditat aprofitable d'un sensor de baixa resolució, NCP-ArchPreview arriba a la qualitat d'una referència amb la meitat dels tokens, Xiaomi-CocktailASR-1 s'estalvia una etapa sencera del procés de transcripció, LangCache deixa de pagar dues vegades per la mateixa resposta i BioIR gairebé triplica la feina científica que cap en una hora de GPU. Al costat del producte, Gemini a Windows, l'estació de 192 GB de System76 i el pont d'Ollama cap a l'aplicació de ChatGPT persegueixen el mateix des de l'altre extrem: escurçar la distància entre l'usuari i el model, tant si viu al núvol com a la taula del costat.

Fonts primàries

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Rep el resum diari d'IA

    Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

    Freqüència:

    ← Torna al blog