Codi obert

Perplexity allibera Lily, el seu motor d'inferència per a Mac

Perplexity AI ha publicat com a open source (codi obert) Lily, el motor d'inferència (el component que executa un model d'IA per a produir respostes) que impulsa la part local de la seva aplicació per a Mac. Escrit en Rust i amb kernels Metal fets a mà, supera el framework de referència d'Apple en les proves de la mateixa companyia i demostra que un model de 35.000 milions de paràmetres pot executar-se amb eficiència en un ordinador de sobretaula.

Rep el resum diari d'IA

Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

Freqüència:

Perplexity allibera Lily, el seu motor d'inferència per a Mac
📷 Perplexity · fuente

En resum

  • Perplexity ha alliberat Lily, un motor d'inferència escrit en Rust i Metal, l'API gràfica (interfície de programació d'aplicacions) d'Apple.
  • Està optimitzat per a un únic model, Qwen3.6-35B-A3B, i una única plataforma: Apple Silicon, els xips de la sèrie M d'Apple.
  • Davant de MLX, el framework de referència d'Apple, aconsegueix un 89% més de rendiment en prefill (processament del prompt) i 1,35 vegades més velocitat en decode (generació de tokens).
  • El codi està disponible en el repositori pplx-garden i inclou una API compatible amb chat-completions d'OpenAI.

Un motor deliberadament especialitzat

Lily neix d'una decisió poc habitual en l'ecosistema de la inferència local: renunciar a la compatibilitat general. En lloc de donar suport a desenes d'arquitectures i a tota mena d'acceleradors, el motor de Perplexity se centra a executar un sol model, Qwen3.6-35B-A3B, sobre una sola família de maquinari, Apple Silicon. Aquesta restricció és precisament el que permet esprémer la màquina fins al límit.

El resultat és un binari compacte: un únic procés escrit en Rust que carrega el checkpoint (el fitxer amb els pesos entrenats del model) i genera text directament, sense capes intermèdies. La comunicació amb les aplicacions es fa mitjançant una API compatible amb l'estàndard chat-completions d'OpenAI, cosa que facilita el streaming (enviament de la resposta token a token, a mesura que es genera) i la integració amb eines ja existents.

El cor del sistema són els kernels Metal escrits a mà. Un kernel és la rutina de baix nivell que s'executa a la GPU (unitat de processament gràfic), i programar-los manualment per a Metal, en lloc de delegar en abstraccions genèriques, és el que explica bona part de les xifres de rendiment.

Què diuen els números davant de MLX

La referència natural per mesurar Lily és MLX, el framework que Apple manté per al treball de machine learning (aprenentatge automàtic) en els seus propis xips. En els mesuraments publicats per Perplexity, Lily millora en un 89% el rendiment en la fase de prefill, és a dir, el processament inicial del prompt (la instrucció o context que rep el model abans de començar a respondre). En la fase de decode, la generació pròpiament dita de tokens, arriba a 1,35 vegades la velocitat de MLX.

També hi ha un resultat negatiu, i la companyia no l'amaga: el speculative decoding (descodificació especulativa), una tècnica que utilitza un model petit per avançar tokens que després valida el model gran, va resultar un 18% més lent en aquest context. Perplexity el va descartar. És una dada rellevant perquè contradiu la intuïció habitual que aquesta optimització sempre compensa, i suggereix que en configuracions molt ajustades el sobrecost de validació pot superar el guany.

La peça local de Hybrid Compute

Lily no és un experiment aïllat, sinó el component en dispositiu de Hybrid Compute, el mode d'execució dividida de l'aplicació Perplexity Computer per a Mac. La idea consisteix a repartir la càrrega: una part de la feina es resol localment, en el mateix ordinador, i una altra s'envia al núvol quan cal més capacitat. Aquest repartiment només té sentit si la meitat local és prou ràpida per a no convertir-se en un coll d'ampolla, i d'aquí l'obsessió pel rendiment.

Per a la comunitat d'IA local i self-hosted (autoallotjada, executada en infraestructura pròpia), la publicació té un valor doble. D'una banda, ofereix una referència de rendiment concreta i verificable contra la qual comparar altres implementacions. De l'altra, demostra que un LLM (large language model, model de llenguatge gran) de 35.000 milions de paràmetres pot funcionar amb eficiència en un Mac de consum, sense dependre de servidors remots ni de targetes gràfiques de centre de dades.

Conclusió

L'aposta de Perplexity és interessant més enllà del programari alliberat: demostra molt sobre el mètode. Lily no aspira a ser un motor universal, i aquesta renúncia explícita a la generalitat és el que li permet superar un framework avalat pel mateix fabricant del maquinari. La lliçó és transferible: en inferència local, on cada mil·lisegon de latència es nota en l'experiència d'ús, l'especialització agressiva continua rendint més que l'abstracció. Queda per veure fins a quin punt el codi és reutilitzable fora de la combinació exacta de model i xip per a la qual va ser dissenyat, i si altres actors adopten un enfocament similar de motors estrets i afinats en lloc de plataformes que ho suportin tot a mitges.

Fonts primàries

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Rep el resum diari d'IA

    Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

    Freqüència:

    ← Torna al blog