Jak funguje vLLM V1: engine, scheduler, KV cache a škálováníRozbor vLLM V1 ukazuje, jak engine, scheduler, KV cache, continuous batching a další mechanismy ovlivňují propustnost a latenci.7. srpna 2026vLLMAIinference
Vylepšení vLLM backendu pro modely transformersNový transformers backend ve vLLM se u mnoha kompatibilních architektur přibližuje rychlosti nativních implementací a někdy je i překonává.10. července 2026vLLMtransformersAI
Jak spustit vLLM server na Hugging Face Jobs jedním příkazemNaučte se, jak jednoduše spustit vLLM server na Hugging Face Jobs pomocí jediného příkazu.26. června 2026vLLMHugging FaceAI