Podpora modelu Qwen3.8-2.4T-A95B na platformě vLLM
Oznámení o podpoře nového modelu Qwen3.8-2.4T-A95B na platformě vLLM přináší technické specifikace.
Firma oznámila podporu modelu Qwen3.8-2.4T-A95B na platformě vLLM, což je první model z rodiny Qwen, který přináší otevřenou váhu pro model třídy Qwen-Max. Tento model má 2.4 bilionu parametrů a využívá 512 expertů.
Model Qwen3.8-2.4T-A95B je postaven na architektuře Qwen 3.5 a běží na vLLM bez nutnosti jakýchkoli změn v architektuře. K dispozici jsou oficiální kontrolní body FP8 a BF16, stejně jako kvantizované váhy MXFP4 a NVFP4, které umožňují efektivní využití paměti a šířky pásma.
Pro spuštění inference je potřeba mít alespoň dva uzly NVIDIA B300 nebo AMD MI355X. Inferact tým potvrdil, že kvantizace zachovává přesnost.
Doporučené parametry generace pro model Qwen 3.8 zahrnují temperature=1.0, top_p=0.95 a top_k=20.
Byly provedeny optimalizace pro efektivní inference na platformách NVIDIA a AMD. Na platformách NVIDIA byly vyvinuty ultra-rychlé jádra pro lineární pozornost a další operace, zatímco na AMD Instinct GPU vLLM zrychluje Qwen3.8 pomocí optimalizovaných jader pro dekódování a pozornost.
Dále, úspěšnost modelu na testu GSM8K dosahuje 89.61% (strict) a 90.52% (flexible), zatímco na testu AIME25 je to 87.78% (avg) a 93.33% (pass).