↓ Ir al contenido
  1. Posts/

vLLM 0.28.0: Más Rendimiento Para La Inferencia De IA

··251 palabras·2 mins·

🚀 vLLM 0.28.0 llega con 584 commits y mejoras enfocadas en ejecutar modelos de lenguaje con mayor velocidad y eficiencia.

⚡ La versión incorpora optimizaciones importantes para Kimi-K3 y DeepSeek V4, además de avances en decodificación especulativa. Esta técnica permite que un modelo auxiliar proponga tokens y que el modelo principal los verifique, reduciendo el tiempo de respuesta.

🧠 También madura Model Runner V2 con descarga de pesos, cachés KV multinivel, gráficos CUDA para codificadores y soporte para modelos sin atención. El almacenamiento KV puede descargar datos hacia disco o CPU, ayudando a servir modelos grandes cuando la memoria de la GPU es limitada.

🌐 El frontend en Rust añade un renderer independiente, inferencia multimodal por gRPC y mejor integración con flujos de aprendizaje por refuerzo. La versión amplía el soporte para NVIDIA, AMD ROCm, Intel XPU y CPU, junto con nuevas rutas de cuantización como NVFP4 y MXFP4.

El equipo del proyecto también elevó algunos valores predeterminados, como los tokens agrupados por lote, y habilitó el almacenamiento en caché de prefijos para modelos Mamba.

💡 Explicación en pocas palabras
#

vLLM es un motor que ayuda a ofrecer modelos de IA a muchas personas al mismo tiempo. Esta actualización optimiza memoria, hardware y generación de texto para responder más rápido y atender cargas mayores.

Más información en el link 👇

También publicado en LinkedIn.

Juan Pedro Bretti Mandarano
Autor
Juan Pedro Bretti Mandarano