
🚀 vLLM 0.28.0 llega con 584 commits y mejoras enfocadas en ejecutar modelos de lenguaje con mayor velocidad y eficiencia.
⚡ La versión incorpora optimizaciones importantes para Kimi-K3 y DeepSeek V4, además de avances en decodificación especulativa. Esta técnica permite que un modelo auxiliar proponga tokens y que el modelo principal los verifique, reduciendo el tiempo de respuesta.
🧠 También madura Model Runner V2 con descarga de pesos, cachés KV multinivel, gráficos CUDA para codificadores y soporte para modelos sin atención. El almacenamiento KV puede descargar datos hacia disco o CPU, ayudando a servir modelos grandes cuando la memoria de la GPU es limitada.
🌐 El frontend en Rust añade un renderer independiente, inferencia multimodal por gRPC y mejor integración con flujos de aprendizaje por refuerzo. La versión amplía el soporte para NVIDIA, AMD ROCm, Intel XPU y CPU, junto con nuevas rutas de cuantización como NVFP4 y MXFP4.
El equipo del proyecto también elevó algunos valores predeterminados, como los tokens agrupados por lote, y habilitó el almacenamiento en caché de prefijos para modelos Mamba.
💡 Explicación en pocas palabras#
vLLM es un motor que ayuda a ofrecer modelos de IA a muchas personas al mismo tiempo. Esta actualización optimiza memoria, hardware y generación de texto para responder más rápido y atender cargas mayores.
Más información en el link 👇
