Código abierto

Paddock, el motor de inferencia en Rust, libera su código

El equipo de truespar ha publicado el 4 de septiembre de 2026 el código fuente de Paddock, su servidor de inferencia escrito desde cero en Rust para tarjetas gráficas de NVIDIA. El proyecto llega con licencia dual MIT/Apache-2.0 y sin dependencias más allá del driver de la propia NVIDIA. Es el tercer movimiento de la semana en una carrera cada vez más disputada por el software que ejecuta los modelos.

Paddock, el motor de inferencia en Rust, libera su código
📷 truespar · fuente

En resumen

  • truespar ha abierto el código de Paddock bajo licencia dual MIT/Apache-2.0 el 4 de septiembre de 2026.
  • No es un envoltorio sobre otro motor: planificador, caché paginada, gestión de memoria y kernels de CUDA son propios.
  • Se distribuye como un único binario para Windows y Linux, con APIs compatibles con OpenAI y Anthropic.
  • En agosto midió 697 milisegundos hasta el primer token con Qwen3.6-27B y 32 clientes concurrentes.

Qué se ha publicado

El equipo de truespar anunció el 4 de septiembre de 2026 la apertura del código de Paddock bajo una licencia dual MIT/Apache-2.0, una fórmula habitual en el ecosistema de Rust que permite a quien lo integre elegir el marco legal que mejor le encaje. El repositorio de GitHub es público, se creó el 3 de septiembre y registró actividad de desarrollo al día siguiente, con fusión de solicitudes de cambios (pull requests) y la publicación de documentación para contribuciones externas.

La compañía ha explicado también cómo sostiene el proyecto: los ingresos proceden de acuerdos de soporte e ingeniería, no de la venta del software. Es un modelo de negocio que separa el código, ofrecido sin coste, del servicio profesional alrededor de él.

Qué es Paddock y por qué importa

Paddock es un servidor de inferencia para modelos de lenguaje grandes (LLM, por sus siglas en inglés) escrito desde cero en Rust y orientado a GPUs (unidades de procesamiento gráfico) de NVIDIA. La distinción que reivindican sus autores es que no se trata de un envoltorio sobre otro motor ya existente: el planificador (scheduler), la caché de clave-valor paginada (paged KV cache), la gestión de memoria y los kernels de CUDA (la plataforma de cómputo paralelo de NVIDIA) forman parte del propio proyecto.

Esa decisión tiene consecuencias prácticas en el despliegue. Paddock se distribuye como un único binario y no arrastra dependencias más allá del driver de NVIDIA, algo poco frecuente en un terreno donde la instalación suele implicar entornos de Python con decenas de paquetes encadenados. Funciona tanto en Windows como en Linux.

En cuanto a compatibilidad, ofrece APIs (interfaces de programación de aplicaciones) compatibles con las de OpenAI y con las de Anthropic, lo que permite reutilizar clientes ya escritos para esos servicios. Carga modelos en los formatos GGUF y safetensors, admite cuantización (reducción de la precisión numérica de los pesos para ahorrar memoria) en FP8, NVFP4, MXFP4, Q8 y Q4, e incorpora un Studio integrado para explorar y comparar modelos con soporte de artefactos.

Contexto: la carrera de la inferencia nativa

El motor no es un recién llegado. Se presentó a finales de agosto de 2026, y en una cobertura del 21 de agosto se difundió una medición de 697 milisegundos de tiempo hasta el primer token (TTFT, por sus siglas en inglés) con el modelo Qwen3.6-27B y 32 clientes simultáneos. En esa misma prueba, vLLM se situó en torno a los 2,5 segundos y llama.cpp en 6,9 segundos.

Paddock se inscribe en una tendencia más amplia: la de los motores de inferencia nativos, que prescinden de frameworks como PyTorch y escriben sus propios kernels en Rust o C++, frente a la vía dominante que representan servidores como vLLM. Esta misma semana han aparecido otras dos piezas del mismo ecosistema, aunque con objetivos distintos: el motor Lily de Perplexity, centrado en ordenadores Mac, y el proxy Switchyard de NVIDIA, que actúa como traductor entre APIs.

La coincidencia temporal dibuja un panorama en el que la capa de ejecución de los modelos deja de ser un detalle de implementación para convertirse en terreno de competencia abierta, con la latencia y la simplicidad de despliegue como principales argumentos.

Conclusión

Con la apertura de Paddock, truespar pone a disposición de la comunidad un motor de inferencia completo cuyo atractivo no está solo en las cifras de latencia, sino en la promesa de un binario único sin cadena de dependencias. Queda por ver si el repositorio, creado hace apenas dos días, consigue atraer y sostener una base de contribuyentes; el modelo de financiación basado en soporte e ingeniería sugiere que la compañía apuesta por que así sea.

Fuentes primarias

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Recibe el resumen diario de IA

    Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

    ← Volver al blog