Podpora modelu NVIDIA Nemotron 3.5 Lightning na platformě vLLM

NVIDIA oznamuje podporu modelu Nemotron 3.5 Lightning na vLLM, který přináší hybridní architekturu a optimalizace pro agentní úkoly.

14. srpna 2026

NVIDIA nedávno oznámila podporu modelu Nemotron 3.5 Lightning na platformě vLLM. Tento model je navržen s hybridní architekturou mixture-of-experts (MoE), která zahrnuje 30 miliard celkových parametrů, přičemž v daném okamžiku je aktivních pouze 3 miliardy parametrů. Tato struktura je optimalizována pro rychlé provádění agentních úkolů, jako je kódování a používání nástrojů.

Jednou z klíčových vlastností modelu je podpora kontextu až do 1 milionu tokenů, což umožňuje efektivní zpracování rozsáhlých datových vstupů. Model dosahuje až 4x vyššího průtoku než srovnatelné otevřené modely, což je důležité pro agentní systémy, které často vykonávají malé, ale četné úkoly.

Nemotron 3.5 Lightning je trénován pro populární agentní platformy a může být dodatečně trénován pro specializované úkoly, což z něj činí flexibilní nástroj pro různé aplikace. Model je distilován z předchozího modelu NVIDIA Nemotron 3 Ultra, což znamená, že přenáší některé pokročilé schopnosti do menšího a efektivnějšího formátu.

Podpora pro model je dostupná na různých platformách, včetně NVIDIA DGX Spark, DGX Station a RTX PRO. Model je k dispozici ve formátech BF16 a NVFP4, což usnadňuje jeho nasazení v datacentrech a cloudu.

Zajímavé na tom je, že s využitím vLLM mohou vývojáři snadno integrovat model do stávajících agentních rámců a aplikací, což zjednodušuje proces nasazení a zvyšuje jeho použitelnost v reálných scénářích.