Efektivní škálování velkých modelů pomocí Distributed Layerwise Offload
Distributed Layerwise Offload ve vLLM-Omni rozděluje váhy velkých generativních modelů mezi více zařízení a snižuje jejich nároky na HBM.
Velké generativní modely mohou snadno překročit kapacitu HBM jednoho akcelerátoru. Příkladem je Cosmos3-Super se 64 miliardami parametrů a přibližně 124 GB vah. Distributed Layerwise Offload (DLO) ve vLLM-Omni řeší tento problém rozdělením vah mezi více zařízení a jejich postupnou rekonstrukcí během výpočtu.
Techniky DLO
DLO kombinuje několik technik zaměřených na snížení paměťových nároků a využití více zařízení:
-
Meta zařízení a mmap načítání vah: V jednom z měřených DP4 workloadů klesla cgroup-visible peak paměť při studeném startu ze 178 GB na 47 GB. Jde o výsledek konkrétní testované konfigurace, ne obecnou hodnotu pro všechny režimy DLO.
-
Sharding vah a AllGather: Každý DP rank ukládá pouze
1 / dp_sizemodelových vah. Celková hostitelská paměť potřebná pro uložené váhy tak neroste jakodp_size × model_size. Potřebné váhy se během výpočtu rekonstruují pomocí AllGather. -
Dvojité vyrovnávací paměti: Na zařízení se současně drží pouze dva transformerové bloky vah. Nároky na HBM tak závisejí především na velikosti největšího bloku, nikoli na velikosti celého modelu.
-
Data parallel multi-concurrency: Jednotlivé DP ranky mohou zpracovávat různé požadavky paralelně. V konkrétním DP4 testu uvádí dokumentace přibližně 3,3× vyšší propustnost oproti použité HSDP baseline.
Měření a výsledky
V měřeném workloadu s 720p videem o délce 10 sekund vzrostla maximální spotřeba HBM při přechodu z modelu 17B na 64B přibližně o 22 %. Autoři DLO popisují jako řešení použitelné na více typech akcelerátorů; testy zahrnovaly mimo jiné NVIDIA GPU a Ascend NPU.
Testy na Ascend 910B3 ověřily, že DLO dokáže v testovaných konfiguracích generovat korektní výstupy. Výkon ale závisí na režimu paralelizace a počtu souběžných požadavků. Například režim s jedním požadavkem může být pomalejší než HSDP, zatímco při více souběžných požadavcích může DLO využít paralelismus výrazně lépe.
Závěr
Distributed Layerwise Offload ve vLLM-Omni ukazuje způsob, jak rozložit paměťové nároky velkých generativních modelů mezi více zařízení. Praktický přínos závisí na konkrétním modelu, hardwaru a workloadu, zejména na míře souběžného zpracování požadavků.