Codi obert

Paddock, el motor d'inferència en Rust, allibera el seu codi

L'equip de truespar ha publicat el 4 de setembre de 2026 el codi font de Paddock, el seu servidor d'inferència escrit des de zero en Rust per a targetes gràfiques de Nvidia. El projecte arriba amb llicència dual MIT/Apache-2.0 i sense dependències més enllà del driver de la pròpia Nvidia. És el tercer moviment de la setmana en una cursa cada cop més disputada pel programari que executa els models.

Rep el resum diari d'IA

Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

Freqüència:

Paddock, el motor d'inferència en Rust, allibera el seu codi
📷 truespar · fuente

En resum

  • truespar ha obert el codi de Paddock sota llicència dual MIT/Apache-2.0 el 4 de setembre de 2026.
  • No és un embolcall sobre un altre motor: planificador, cau paginada, gestió de memòria i kernels de CUDA són propis.
  • Es distribueix com un únic binari per a Windows i Linux, amb APIs compatibles amb OpenAI i Anthropic.
  • A l'agost va mesurar 697 mil·lisegons fins al primer token amb Qwen3.6-27B i 32 clients concurrents.

Què s'ha publicat

L'equip de truespar va anunciar el 4 de setembre de 2026 l'obertura del codi de Paddock sota una llicència dual MIT/Apache-2.0, una fórmula habitual en l'ecosistema de Rust que permet a qui l'integri triar el marc legal que millor li encaixi. El repositori de GitHub és públic, es va crear el 3 de setembre i va registrar activitat de desenvolupament l'endemà, amb fusió de sol·licituds de canvis (pull requests) i la publicació de documentació per a contribucions externes.

La companyia ha explicat també com sosté el projecte: els ingressos procedeixen d'acords de suport i enginyeria, no de la venda del programari. És un model de negoci que separa el codi, ofert sense cost, del servei professional al seu voltant.

Què és Paddock i per què importa

Paddock és un servidor d'inferència per a models de llenguatge grans (LLM, per les seves sigles en anglès) escrit des de zero en Rust i orientat a les GPU (unitats de processament gràfic) de Nvidia. La distinció que reivindiquen els seus autors és que no es tracta d'un embolcall sobre un altre motor ja existent: el planificador (scheduler), la cau de clau-valor paginada (paged KV cache), la gestió de memòria i els kernels de CUDA (la plataforma de còmput paral·lel de Nvidia) formen part del projecte mateix.

Aquesta decisió té conseqüències pràctiques en el desplegament. Paddock es distribueix com un únic binari i no arrossega dependències més enllà del driver de Nvidia, una cosa poc freqüent en un terreny on la instal·lació sol implicar entorns de Python amb desenes de paquets encadenats. Funciona tant en Windows com en Linux.

Quant a compatibilitat, ofereix APIs (interfícies de programació d'aplicacions) compatibles amb les d'OpenAI i amb les d'Anthropic, cosa que permet reutilitzar clients ja escrits per a aquests serveis. Carrega models en els formats GGUF i safetensors, admet quantització (reducció de la precisió numèrica dels pesos per estalviar memòria) en FP8, NVFP4, MXFP4, Q8 i Q4, i incorpora un Studio integrat per explorar i comparar models amb suport d'artefactes.

Context: la cursa de la inferència nativa

El motor no és un nouvingut. Es va presentar a finals d'agost de 2026, i en una cobertura del 21 d'agost es va difondre un mesurament de 697 mil·lisegons de temps fins al primer token (TTFT, per les seves sigles en anglès) amb el model Qwen3.6-27B i 32 clients simultanis. En aquesta mateixa prova, vLLM es va situar al voltant dels 2,5 segons i llama.cpp en 6,9 segons.

Paddock s'inscriu en una tendència més àmplia: la dels motors d'inferència natius, que prescindeixen de frameworks com PyTorch i escriuen els seus propis kernels en Rust o C++, davant la via dominant que representen servidors com vLLM. Aquesta mateixa setmana han aparegut dues altres peces del mateix ecosistema, tot i que amb objectius diferents: el motor Lily de Perplexity, centrat en ordinadors Mac, i el proxy Switchyard de Nvidia, que actua com a traductor entre APIs.

La coincidència temporal dibuixa un panorama en què la capa d'execució dels models deixa de ser un detall d'implementació per convertir-se en terreny de competència oberta, amb la latència i la simplicitat de desplegament com a principals arguments.

Conclusió

Amb l'obertura de Paddock, truespar posa a disposició de la comunitat un motor d'inferència complet l'atractiu del qual no rau només en les xifres de latència, sinó en la promesa d'un binari únic sense cadena de dependències. Queda per veure si el repositori, creat fa tot just dos dies, aconsegueix atraure i sostenir una base de contribuents; el model de finançament basat en suport i enginyeria suggereix que la companyia aposta perquè així sigui.

Fonts primàries

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Rep el resum diari d'IA

    Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

    Freqüència:

    ← Torna al blog