Gauntlet testuje víceagentní analýzu článků o počítačové architektuře
Studie testuje víceagentní systém Gauntlet pro kritickou analýzu odborných článků. V malém experimentu byly jeho výstupy často preferovány před lidskými, systém ale zůstával slabší v důvěryhodnosti a praktické užitečnosti.
Studie „Can LLMs Perform Deep Technical Comprehension of Computer Architecture Papers?“ testuje systém Gauntlet pro strukturovanou kritiku odborných článků o počítačové architektuře.
Nejde o obecný test toho, zda všechny jazykové modely rozumějí hardwarové architektuře. Autoři hodnotí konkrétní víceagentní systém, který rozděluje analýzu mezi pět nezávislých expertních rolí a následně jejich výstupy spojuje pomocí adversariální syntézy.
Systém má hodnotit například technickou správnost, experimentální metodiku, novost, praktické dopady a možné slabiny článku. Cílem není pouze shrnutí textu, ale vytvoření kritické analýzy podobné odbornému recenznímu posudku.
Autoři porovnali výstupy Gauntletu s lidskými analýzami u 20 článků z konferencí ISCA 2025 a HPCA 2026. Podle studie hodnotitelé preferovali výstup Gauntletu v 15 případech. Lidská analýza byla preferována ve čtyřech případech a jedno porovnání skončilo remízou.
Tento výsledek je potřeba číst opatrně. Jde o malý experiment na omezeném souboru článků a o konkrétní systém sestavený autory studie. Nejde o nezávislý benchmark všech jazykových modelů ani všech typů technických dokumentů.
Lidské analýzy si podle autorů vedly lépe hlavně v důvěryhodnosti a praktické užitečnosti. Gauntlet někdy vytvářel sebejistá chybná tvrzení, nedostatečně vysvětloval mechanismy nebo produkoval příliš široké odpovědi bez jasné prioritizace nejdůležitějších problémů.
Studie obsahuje také automatickou ablaci na 98 článcích. Autoři uvádějí, že víceagentní struktura překonala stejný model spuštěný jako jediný bohatě definovaný agent u 96 % článků. Jde ale o interní experiment autorů a výsledek závisí na jejich způsobu hodnocení.
Praktickým závěrem proto není, že jazykové modely obecně překonaly odborníky. Studie spíš ukazuje, že dobře navržený víceagentní proces může při kritické analýze technických článků vytvořit užitečnější výstup než jeden samostatný agent.
Současně zůstává důležité ověřovat faktická tvrzení, sledovat míru jistoty a zapojovat lidského odborníka tam, kde záleží na důvěryhodnosti a praktickém rozhodování.