Porovnání výkonu Grok 4.5, GPT-5.5 a Claude při generování aplikací

TryAI porovnalo Grok 4.5, GPT-5.5, Claude Opus 4.8 a Claude Fable 5 na třech stejných zadáních pro jednosouborové HTML aplikace.

9. července 2026

TryAI ve svém srovnávacím testu porovnalo čtyři modely: Grok 4.5, GPT-5.5, Claude Opus 4.8 a Claude Fable 5. Všechny dostaly stejná zadání pro vytvoření interaktivních jednosouborových HTML aplikací.

Je důležité číst výsledky jako konkrétní produktový test TryAI, ne jako obecný benchmark schopností všech modelů. Test ukazuje, jak si modely vedly v daných zadáních, v daném prostředí a podle hodnocení autora zdroje. Při úplném nerenderování aplikace byl povolen jeden opakovaný pokus.

Kolo 1: 3D Rubikova kostka

Prvním úkolem bylo vytvořit 3D Rubikovu kostku, která se správně otáčí a má funkce pro scramble a solve.

Claude Opus 4.8 a Claude Fable 5 podle TryAI uspěly na první pokus a vytvořily funkční barevné 3D kostky. Grok 4.5 měl v prvním pokusu problém s vykreslením, ale po povoleném opakování se mu podařilo kostku vygenerovat. GPT-5.5 podle zdroje vykreslil pouze jednu tmavou stranu.

Kolo 2: Interaktivní sandbox s částicemi

Druhým úkolem byl interaktivní sandbox s částicemi.

V tomto kole vytvořily všechny modely funkční aplikaci. TryAI označuje výstup GPT-5.5 za vizuálně nejpůsobivější, hlavně díky neonovým atraktorům a barevným stopám. Grok 4.5 měl čistší orbitální vzhled a Claude modely nabídly vlastní odlišné přístupy.

Kolo 3: Hra Breakout

Třetím úkolem bylo vytvořit hratelnou verzi hry Breakout.

Všechny čtyři modely podle zdroje vytvořily hru na první pokus. Výstupy obsahovaly základní herní logiku, skóre a životy. V tomto konkrétním zadání tedy modely působily vyrovnaněji než u Rubikovy kostky.

Metriky: rychlost a náklady

TryAI vedle kvality výstupů porovnalo také několik provozních metrik.

Grok 4.5 měl podle měření nejnižší cenu za odpověď, nejrychlejší první token a nejvyšší throughput. U mediánové latence ale nebyl nejrychlejší: Grok 4.5 měl 2,8 sekundy, zatímco GPT-5.5 mělo 2,0 sekundy. Claude Opus 4.8 měl 2,6 sekundy a Claude Fable 5 6,3 sekundy.

To znamená, že Grok 4.5 v tomto testu vyšel velmi dobře z hlediska ceny, prvního tokenu a throughputu, ale není přesné říct, že byl nejrychlejší ve všech metrikách.

Bonusové kolo: SVG scéna

V bonusovém kole měly modely vytvořit zábavnou SVG scénu.

Podle TryAI v tomto kole nejvíc zaujal Claude Fable 5 se scénou koně na astronautovi. Jde ale o subjektivnější kreativní úlohu, kde výsledek závisí nejen na funkčnosti, ale i na vkusu hodnotitele.

Zajímavé na tomto srovnání není jen to, který model „vyhrál“. Užitečnější je sledovat rozdíly mezi typy úloh. Grok 4.5 vynikal provozními metrikami, Claude modely dobře obstály u první stavové úlohy a GPT-5.5 zaujalo ve vizuálním sandboxu s částicemi.

Výsledek proto dává smysl brát jako praktický pohled na několik konkrétních promptů, ne jako definitivní pořadí modelů pro generování aplikací.