Otras noticias

Otras noticias

Ocho avances que no llegaron a portada pero marcan el pulso del día: radar que reconstruye la profundidad de una escena cuando la vista falla, un modelo de lenguaje que aprende a predecir conceptos y no solo palabras, transcripción de una voz concreta en medio del ruido, memoria caché por significado para abaratar las llamadas a los modelos, cálculo biomolecular acelerado en GPU, la llegada de Gemini a Windows, una estación de trabajo Linux con 192 GB de memoria gráfica y el puente entre Ollama y la aplicación de escritorio de ChatGPT. Todo apunta al mismo sitio: hacer más con los mismos vatios, los mismos tokens y el mismo hardware.

Recibe el resumen diario de IA

Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

Frecuencia:

Otras noticias
📷 Redis · interfaz oficial de LangCache, una de las noticias del recopilatorio · fuente

En resumen

  • GRADE calcula la distancia a cada punto de la escena con un solo fotograma de radar de ondas milimétricas: 0,303 m de error medio en escenas limpias y 0,313 m con humo real.
  • NCP-ArchPreview, de 8.900 millones de parámetros, iguala la pérdida final de OLMo-3-7B con solo el 51,3 % de los tokens de entrenamiento.
  • Xiaomi-CocktailASR-1 transcribe a un hablante concreto sin separar antes las voces y devuelve texto vacío si esa persona no aparece en la grabación.
  • Redis LangCache asegura que recorta hasta un 90 % el coste de las llamadas a los modelos y sirve los aciertos de caché hasta 15 veces más rápido.
  • BioIR, de NVIDIA, multiplica por 2,90 el rendimiento de plegado de Boltz-2: 58.500 residuos por hora de GPU en 8 H100.
  • Google lanza la aplicación de Gemini para Windows.
  • System76 presenta Thelio Mira AI, una estación de trabajo Linux con 192 GB de memoria de GPU.
  • Ollama 0.34 permite apuntar la aplicación de escritorio de ChatGPT a modelos abiertos, en la nube o en el propio ordenador.

GRADE reconstruye la profundidad de una escena con un solo fotograma de radar

Reconstrucción de la profundidad de una escena con un solo fotograma de radar mediante GRADE
📷 Zhao, Chiou y Garg / GRADE · CC BY-NC-SA 4.0 · fuente

La percepción del espacio en tres dimensiones se rompe justo cuando más falta hace. El humo, la niebla y la oscuridad ciegan a los sensores ópticos porque las partículas en suspensión impiden que la luz regrese, y un bombero o un robot de rescate se quedan sin mapa del terreno que pisan. El radar de ondas milimétricas sí aguanta esas condiciones y mide distancias con precisión, pero su antena es pequeña y por eso distingue muy mal la dirección de la que viene cada eco: sabe a qué distancia está algo, no qué forma tiene.

GRADE corrige ese desequilibrio apoyando un modelo generativo ya entrenado en la geometría que aporta el radar. Primero convierte las señales crudas del radar 4D en una estimación aproximada de la distancia a cada punto. Después, un modelo de difusión reconstruye el detalle de las formas: en cada paso de limpieza de ruido usa esa primera estimación como guía. Un módulo adicional aprovecha lo poco que aún ve la cámara cuando queda algo visible, y el conjunto se entrena con imágenes limpias, con humo y con obstáculos delante, de modo que el sistema se apoya cada vez más en el radar según empeora la visibilidad.

Las cifras proceden de unos 95.000 fotogramas grabados en doce edificios con humo real, no simulado. GRADE se equivoca de media en 0,303 metros con la escena despejada y en 0,313 metros con humo, mejor que los sistemas de referencia existentes. Ese centímetro escaso de diferencia entre lo fácil y lo difícil es el verdadero hallazgo: el rendimiento apenas se resiente. El código y los conjuntos de datos están publicados.

Leer más: arXiv ↗

NCP-ArchPreview aprende a predecir conceptos, no solo la palabra siguiente

Esquema de NCP-ArchPreview, que predice conceptos además de la palabra siguiente
📷 The Intern-NCP Team / Shanghai AI Lab y LUMIA Lab · fuente

Un modelo de lenguaje convencional se entrena para acertar la siguiente palabra. NCP-ArchPreview añade un objetivo más ambicioso: predecir conceptos, unidades de significado que abarcan varias palabras a la vez. Para lograrlo crea su propio vocabulario de conceptos a partir de sus estados internos, mediante una técnica de compresión llamada cuantización por producto, y un módulo específico aprende a anticipar qué conceptos vienen después. Esas predicciones vuelven al nivel de la palabra para orientar la generación, y los dos objetivos se entrenan a la vez.

La demostración ha escalado hasta 8.900 millones de parámetros y 5,73 billones de tokens del conjunto Dolma-3, lo que sus autores describen como el mayor modelo de lenguaje en espacio latente construido hasta la fecha. El resultado más llamativo es de eficiencia: con apenas el 51,3 % de los tokens totales, el modelo ya iguala la pérdida final de preentrenamiento de OLMo-3-7B. Cuando termina el entrenamiento, lo supera en 2,45 puntos en la media de tareas posteriores y gana 5,99 puntos en GSM8K, el banco de pruebas de problemas matemáticos.

Los experimentos controlados distinguen cuánto aporta la arquitectura latente y cuánto el objetivo conceptual, y ambos mejoran de forma clara. Con solo el 85 % del cómputo habitual, el modelo casi alcanza la pérdida de una referencia de 8.900 millones de parámetros idénticamente dimensionada. El espacio latente sigue rindiendo después: basta actualizar el módulo de cuantización, de 17 millones de parámetros, para adaptar el modelo a un dominio nuevo sin tocar el resto, e inyectar las representaciones conceptuales en un borrador DFlash2 alarga un 4,17 % el texto aceptado de media, con un coste añadido insignificante.

Leer más: arXiv ↗

Xiaomi-CocktailASR-1 transcribe una sola voz dentro del barullo

Xiaomi-CocktailASR-1 frente al problema de transcribir una voz entre varias superpuestas
📷 Zhang et al. / Xiaomi-CocktailASR-1 · CC BY 4.0 · fuente

El reconocimiento del habla apoyado en grandes modelos de lenguaje ha avanzado mucho, casi siempre dando por hecho que habla una sola persona. En cuanto varias voces se pisan —el clásico problema de la fiesta de cóctel— la precisión se desploma. Los sistemas actuales que intentan seguir a un hablante concreto, ya usen arquitecturas de extremo a extremo con huellas vocales o los ensayos más recientes con modelos de lenguaje, arrastran dos defectos: empeoran cuando solo habla una persona y no saben callarse cuando la voz que buscan no está.

Xiaomi-CocktailASR-1 propone una única arquitectura de extremo a extremo que recibe una muestra de referencia como huella vocal, a modo de instrucción. Con ella transcribe directamente lo que dice esa persona, sin separar antes las voces en pistas distintas. El sistema sigue rindiendo bien cuando solo habla uno, al nivel de los modelos de reconocimiento convencionales, y sabe descartar: si la voz buscada no aparece en la grabación, devuelve texto vacío.

El modelo incluye además un modo de razonamiento paso a paso que muestra cómo llega a cada decisión. En pruebas amplias sobre grabaciones con varios hablantes, tanto sintéticas como reales, sus autores declaran resultados a la altura del estado del arte, con un equilibrio entre precisión con varias voces, precisión con una sola y capacidad de abstenerse que hasta ahora exigía combinar sistemas distintos.

Leer más: arXiv ↗

Redis lanza LangCache, una caché por significado para abaratar la inferencia

Redis LangCache, servicio gestionado de caché por significado para reducir el coste de la inferencia
📷 Redis · visual oficial de LangCache · fuente

Las aplicaciones que usan modelos de lenguaje en producción casi nunca reciben una pregunta realmente inédita. Los asistentes de soporte y los sistemas de recuperación aumentada atienden las mismas intenciones miles de veces al día, formuladas de mil maneras, y la mayoría de las arquitecturas tratan cada variante como una petición nueva que se factura entera. El derroche es de diseño: se paga una y otra vez por generar la misma respuesta con otras palabras.

Redis LangCache es un servicio gestionado que se coloca entre la aplicación y el modelo y guarda las respuestas ya dadas. En vez de comparar textos idénticos, mide si dos preguntas significan lo mismo, así que acierta aunque la redacción cambie por completo. Al venir gestionado, ahorra a cada equipo construir y mantener su propia capa de representaciones vectoriales, umbrales de parecido y caducidad de la caché.

Las cifras del lanzamiento hablan de recortar hasta un 90 % el coste de las llamadas a la interfaz del modelo y de servir los aciertos de caché hasta quince veces más rápido. Conviene leerlas como techo, no como media: el ahorro real depende de cuánta repetición haya en el tráfico y de hasta qué punto el caso de uso tolere una respuesta generada tiempo atrás.

Leer más: MarkTechPost ↗

BioIR multiplica por 2,90 el plegado de proteínas de Boltz-2

BioIR, de NVIDIA, acelera 2,90 veces el plegado de proteínas de Boltz-2
📷 NVIDIA · BioNeMo Inference Runtime · fuente

NVIDIA ha detallado BioNeMo Inference Runtime, o BioIR, una biblioteca de Python que acelera en sus GPU los modelos que predicen la estructura de moléculas biológicas, sin salir de PyTorch. Esa condición pesa más de lo que parece: quedarse dentro de PyTorch evita que los laboratorios reescriban sus procesos o migren a otro formato de despliegue solo para ganar velocidad.

La aceleración actúa en tres frentes. El primero, núcleos de cómputo escritos a medida. El segundo, la captura mediante CUDA Graph, que recorta el coste de lanzar una y otra vez las mismas operaciones. El tercero, un reparto por réplicas gestionado con Ray que instala una copia completa del modelo en cada GPU. En una comparación en igualdad de condiciones sobre 1.000 dímeros humanos con ocho H100, Boltz-2 acelerado con BioIR plegó 58.500 residuos por hora de GPU, frente a los 20.200 de una implementación abierta compilada con torch: 2,90 veces más.

Ese rendimiento ya ha dado fruto científico. Según NVIDIA, BioIR fue el motor de la ampliación de la base de datos de AlphaFold, con unos 31 millones de complejos proteicos candidatos generados a lo largo de 4.777 proteomas. Es la clase de salto que convierte un cribado computacional inabordable en un trabajo de días.

Leer más: MarkTechPost ↗

Google lanza la aplicación de Gemini para Windows

La aplicación de Gemini, ya disponible para Windows
📷 Google · Gemini para ordenadores · fuente

Google ha anunciado que la aplicación de Gemini ya está disponible para Windows. Con ello su asistente completa la presencia en el escritorio más usado del mundo y los usuarios pueden recurrir a la inteligencia artificial de Google sin pasar por el navegador.

Una aplicación nativa se nota en detalles cotidianos: atajos de teclado que funcionan desde cualquier programa, integración con las ventanas del sistema y la posibilidad de invocarla sin tener una pestaña abierta.

La batalla por el asistente de escritorio se libra en los segundos que cuesta empezar, y poner un icono propio en Windows va justo de eso: acortar la distancia entre la duda y la pregunta al modelo. El despliegue oficial arrancó el 10 de septiembre.

Leer más: Google ↗

System76 presenta Thelio Mira AI, una estación Linux con 192 GB de memoria de GPU

Thelio Mira AI, la estación de trabajo Linux de System76 con 192 GB de memoria de GPU
📷 System76 · Thelio Mira AI · fuente

System76 ha presentado Thelio Mira AI, una estación de trabajo Linux construida alrededor de una cifra: 192 GB de memoria de GPU. Ese número decide qué se puede hacer en el propio ordenador y qué no, porque el límite para ejecutar o afinar un modelo grande casi nunca es la potencia de cálculo, sino cuántos parámetros caben sin trocear el trabajo.

Con ese margen entran en memoria modelos que en una tarjeta de consumo obligan a recortar precisión de forma drástica, repartir capas entre varias tarjetas o descargar pesos a la memoria del sistema, con la pérdida de velocidad que eso acarrea. También permite ajustar modelos con textos muy largos y procesar más peticiones a la vez sin malabares de configuración.

El posicionamiento es claro: una alternativa de sobremesa para equipos que prefieren no alquilar cómputo en la nube, sea por el coste recurrente, por la confidencialidad de los datos o simplemente por tener el hardware a mano. Que venga con Linux instalado de fábrica ahorra además el habitual dolor de cabeza de los controladores y los entornos de cálculo.

Leer más: System76 ↗

Ollama 0.34 conecta la aplicación de escritorio de ChatGPT con modelos abiertos

Ollama 0.34 conectando la aplicación de escritorio de ChatGPT con modelos abiertos
📷 Ollama · notas oficiales de v0.34.0 · fuente

Ollama 0.34 permite configurar la aplicación de escritorio de ChatGPT para que responda con modelos servidos por Ollama. En macOS el procedimiento consiste en abrir Ollama, activar la opción de ChatGPT, dejar que el propio Ollama configure y arranque la aplicación y elegir después un modelo abierto en el selector.

Entre los modelos recomendados aparecen GLM-5.3-Flash, DeepSeek-V4 y Kimi-K3. Para tareas delicadas, Ollama sugiere modelos que se ejecutan enteros en el propio ordenador, como Gemma 4 y Qwen 3.8. Se pueden fijar hasta cinco modelos en los ajustes y combinar los de la nube con los locales según el tipo de consulta.

La compañía sostiene que la búsqueda web, los complementos y el control del ordenador siguen funcionando sin ajustes adicionales, y menciona compatibilidad con extensiones como Notion, Granola, GitHub y Google Calendar. Si se cumple, el atractivo está claro: mantener la interfaz de escritorio a la que muchos ya se han acostumbrado y decidir aparte qué modelo contesta.

Leer más: Ollama ↗

Conclusión

El día no deja un gran titular, sino una suma de mejoras en la misma dirección: gastar menos para conseguir lo mismo o más. GRADE saca profundidad aprovechable de un sensor de baja resolución, NCP-ArchPreview alcanza la calidad de una referencia con la mitad de los tokens, Xiaomi-CocktailASR-1 se salta una etapa entera del proceso de transcripción, LangCache deja de pagar dos veces por la misma respuesta y BioIR casi triplica el trabajo científico que cabe en una hora de GPU. En el lado del producto, Gemini en Windows, la estación de 192 GB de System76 y el puente de Ollama hacia la aplicación de ChatGPT persiguen lo mismo desde el otro extremo: acortar la distancia entre el usuario y el modelo, viva este en la nube o en la mesa de al lado.

Fuentes primarias

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Recibe el resumen diario de IA

    Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

    Frecuencia:

    ← Volver al blog