IsoExec: Sjednocené provádění pro eliminaci nesouladu mezi tréninkem a inference v SkyRL

IsoExec představuje novou metodu pro sjednocení provádění v reinforcement learningu, která eliminuje nesoulad mezi tréninkovými a inference enginy.

22. srpna 2026

V oblasti reinforcement learningu (RL) je klíčovým požadavkem, aby tréninkový a inference engine pracovaly s identickou politikou. V praxi však často dochází k nesouladu mezi těmito dvěma enginy, což může vést k problémům s výkonností a stabilitou. Nový přístup, IsoExec, se snaží tento problém vyřešit prostřednictvím sjednoceného provádění, které eliminuje nesoulad mezi tréninkovými a inference enginy.

Hlavní přínosy IsoExec

IsoExec se skládá ze dvou hlavních komponentů: vykonávacího kontraktu a sjednoceného modelu. Vykonávací kontrakt specifikuje a vynucuje detaily provádění, které ovlivňují zaokrouhlování čísel mezi různými enginy. Sjednocený model pak zajišťuje, že jádra jsou konzistentní napříč tréninkem a inference, což umožňuje dosáhnout bitwise konzistence.

Implementace IsoExec byla provedena v rámci SkyRL s použitím technologií vLLM a Megatron. Během experimentů se podařilo snížit průměrný rozdíl logprob mezi rolloutem a tréninkem na méně než 0.01, což ukazuje na efektivitu této metody při eliminaci nesouladu.

Sjednocený vykonávací kontrakt a model

Vykonávací kontrakt IsoExec se zaměřuje na detaily, které mohou ovlivnit výsledky provádění, jako jsou implementace jader, typy akumulace a pořadí redukce. Tento kontrakt zajišťuje, že obě runtime prostředí dodržují identické specifikace, což minimalizuje náklady na ladění nových RL algoritmů a změny v RL prostředích.

Sjednocený model IsoExec používá jádra, která byla validována pro bitwise konzistenci. To znamená, že provádění je konzistentní napříč různými paralelními konfiguracemi, což je důležité pro stabilitu tréninkových procesů.

Paralelní jádra a Chunkwise-parallel Gated DeltaNet

IsoExec implementuje paralelní jádra, která zachovávají numeriku napříč různými paralelními strategiemi. To je klíčové pro zajištění, že výsledky tréninku a inference budou shodné, i když se používají různé paralelní konfigurace.

Dále IsoExec využívá Chunkwise-parallel recurrent (CPR) Gated DeltaNet, což umožňuje provádět trénink, prefill a dekódování bez nutnosti serializace dlouhých sekvencí. Tento přístup zajišťuje, že se eliminují rozdíly v zaokrouhlování mezi různými fázemi provádění.

Výsledky a experimenty

V experimentu provedeném na jednom uzlu s osmi GPU H100 bylo zjištěno, že IsoExec přináší 25% overhead ve srovnání s nativním stackem SkyRL. Průměrný čas potřebný pro generaci s IsoExec byl 776.6 sekund, zatímco pro trénink to bylo 591.3 sekund. Celkový čas pro jeden RL krok dosáhl 1534.0 sekund.

Přestože IsoExec přinesl snížení rozdílu logprob, během krátkého testu nebylo pozorováno významné zlepšení odměn. To naznačuje, že i když IsoExec efektivně eliminuje nesoulad, nemusí to nutně vést k okamžitému zlepšení výkonu v rámci odměn.

Další kroky

V budoucnu se plánuje rozšíření IsoExec o další funkce, jako je podpora Blackwell, invariance kontextu paralelismu a implementace sparse attention. Tyto kroky by měly dále zlepšit stabilitu a efektivitu tréninkových procesů v reinforcement learningu.

IsoExec představuje inovativní přístup k eliminaci nesouladu mezi tréninkovými a inference enginy v reinforcement learningu. Jeho implementace v SkyRL ukazuje, že sjednocené provádění může zjednodušit proces ladění nových RL algoritmů a zlepšit stabilitu tréninkových procesů, i když s určitými náklady na overhead.