Optimalizace modelu DeepSeek V4 Flash na AMD MI300X

Jak nasadit model DeepSeek V4 Flash na jednom GPU AMD MI300X s důrazem na výkon a konfiguraci.

4. srpna 2026

Model DeepSeek V4 Flash byl nasazen na jednom GPU AMD MI300X. Repozitář obsahuje konfiguraci a opravy pro provoz modelu v produkčním prostředí.

Výhody nasazení na MI300X

AMD MI300X je vybaven 192 GB HBM3 a dosahuje paměťové šířky pásma 5.3 TB/s. Tato specifikace umožňuje nasazení celého modelu do HBM bez nutnosti PCIe streamování nebo offloadování vrstev. Celková velikost váhy modelu je 156.67 GiB, což znamená, že veškeré potřebné váhy modelu mohou být uloženy přímo v paměti GPU.

Výkon modelu

Podle dostupných výsledků dosahuje model DeepSeek V4 Flash výkonu 168.6 tok/s pro dekódování na jednom streamu. Prefill s laděnými jádry pak dosahuje přibližně 7.9–8.5K tok/s. Tyto hodnoty ukazují na efektivitu modelu při zpracování dat.

Opravy a konfigurace

Repozitář obsahuje také opravy, které jsou nezbytné pro spolehlivý provoz na MI300X. Mezi nimi jsou opravy pro FP8 formát a MoE routování. Doporučená konfigurace zahrnuje 2,048-token scheduler budget a Caddy jako HTTPS proxy.

Závěrečné poznámky

Je důležité mít na paměti, že HBM headroom je omezený a může vést k chybám při nedostatečné paměti. Testování správnosti je klíčové, protože různé cesty mohou mít odlišné floating-point výsledky.

Zajímavé na tomto nasazení je, že díky vysoké kapacitě paměti a optimalizovanému výkonu se model DeepSeek V4 Flash stává atraktivní volbou pro vývojáře, kteří hledají řešení pro zpracování velkých objemů dat na jednom GPU.