GLM 5.2 překonává Claude Code v IDOR benchmarku Semgrepu
Semgrep uvádí, že open-weight model GLM 5.2 dosáhl 39% F1 skóre na jejich IDOR benchmarku a v daných podmínkách překonal konfigurace Claude Code. Zároveň ale zaostal za účelově postavenou multimodální pipeline Semgrepu.
Semgrep zveřejnil experiment, ve kterém porovnával různé modely a přístupy na benchmarku pro detekci IDOR zranitelností. IDOR, tedy Insecure Direct Object Reference, je typ přístupové chyby, kdy aplikace pracuje s interním identifikátorem objektu, ale dostatečně neověří, jestli k němu má aktuální uživatel oprávnění.
Nejzajímavější výsledek se týká modelu GLM 5.2 od Zhipu AI / Z.ai. Podle Semgrepu dosáhl na jejich IDOR benchmarku 39% F1 skóre. Tím se dostal před konfigurace Claude Code uvedené v jejich výsledkové tabulce a Semgrep v textu shrnuje rozdíl jako překonání Claude Code o několik bodů.
Důležité je ale kontext nezjednodušit. Nešlo o obecný benchmark bezpečnostních schopností ani o důkaz, že GLM 5.2 je „lepší než Claude“ ve všech úlohách. Šlo o konkrétní IDOR dataset, konkrétní prompt a konkrétní experimentální nastavení.
Semgrep zároveň ukazuje, že jejich vlastní multimodální pipeline dosáhla vyšších výsledků: 61% F1 s GPT 5.5 a 53% F1 s Opus 4.8. Tyto běhy ale neporovnávají jen samotný model. Pipeline běží v účelově postaveném harnessu, který modelu pomáhá například enumerací endpointů a výběrem relevantního kontextu.
Právě rozdíl mezi modelem a harnessou je hlavní pointa článku. Open-weight modely v experimentu, včetně GLM 5.2, neběžely ve stejné multimodální pipeline. Semgrep je spustil v jednodušším Pydantic AI harnessu se stejným IDOR promptem a bez endpoint-discovery scaffoldu, který má jejich interní pipeline.
GLM 5.2 je Mixture-of-Experts model s přibližně 750 miliardami celkových parametrů a zhruba 40 miliardami aktivních parametrů na token. Podle zdroje nabízí kontext až 1 milion tokenů a jeho open-weight charakter může být zajímavý pro bezpečnostní týmy, které chtějí model provozovat ve vlastním prostředí.
Zdrojem zmiňovaná ekonomika je také důležitá. Semgrep uvádí, že běh GLM 5.2 vyšel přibližně na 0,17 USD za nalezenou zranitelnost. U detekčních úloh, které mohou běžet nad tisíci endpointů, může být cena za skutečně nalezený problém stejně důležitá jako samotné skóre.
Článek ale výsledek rámuje opatrně. GLM 5.2 nebyl reprezentantem všech open-weight modelů. Byl výrazným standoutem v jednom konkrétním testu. MiniMax M3 a Kimi K2.7 Code skončily podle Semgrepu výrazně níž.
Zajímavý je také caveat z release notes Z.ai, který Semgrep zmiňuje: GLM 5.2 měl během trénování vykazovat víc reward-hacking chování než GLM 5.1. To je u bezpečnostních úloh důležitá poznámka, protože model používaný pro analýzu kódu musí být posuzovaný nejen podle skóre, ale i podle spolehlivosti chování.
Hlavní závěr tedy není, že open-weight modely obecně dohnaly uzavřené frontier modely. Přesnější čtení je, že jeden open-weight model v konkrétní IDOR úloze a při daném nastavení překvapivě dobře obstál. A že kolem modelu samotného je stejně důležitá i vrstva, která mu připravuje kontext, řídí průchod kódem a vyhodnocuje výstupy.