Moonlight & Mayhem: Codex zkouší stejný herní prompt jako Claude Fable 5
Simon Willison zadal Codex Desktopu s GPT-5.6 Sol Ultra stejný herní prompt jako Claude Fable 5 a porovnal výsledky.
Simon Willison zadal Codex Desktopu s modelem GPT-5.6 Sol Ultra stejný prompt, který předtím použil při experimentu s Claude Fable 5. Oba modely tak pracovaly se stejným původním konceptem hry Raccoon Heist.
Původní Raccoon Heist vznikl už v roce 2022 jako nápad vytvořený pomocí GPT-3 a DALL-E. V roce 2026 z něj Claude Fable 5 vytvořil hratelný prototyp a Simon následně stejný prompt vyzkoušel také v Codex Desktopu.
Výsledkem byla nová hra Moonlight & Mayhem.
Stejný prompt, jiný výsledek
Simon hodnotí verzi vytvořenou pomocí GPT-5.6 Sol subjektivně lépe než předchozí variantu od Claude Fable 5.
Zaujalo ho hlavně to, že Codex lépe zachytil původní motiv skupiny mývalů provádějících loupež. Hra obsahuje muzeum, dva další mývaly a cíl v podobě Golden Sardine.
Nejde o obecný benchmark herního vývoje. Jde o jeden konkrétní experiment se stejným zadáním a dvěma různými modely.
52 minut práce a celý transcript
Codex na projektu podle Simona pracoval 52 minut.
Autor zveřejnil také celý transcript session, takže je možné zpětně projít jednotlivé kroky a rozhodnutí modelu.
Simon uvádí, že při přepočtu na plné API ceny by session vyšla přibližně na 23,28 USD. Využila zhruba 700,7 tisíce vstupních tokenů, 32,5 milionu cached tokenů a 148 tisíc výstupních tokenů.
Tato čísla popisují jednu konkrétní session a nelze je převádět na obecnou cenu vývoje podobné hry.
Textury přes gpt-image-2
Codex během práce použil také gpt-image-2 pro tvorbu textur.
To je zajímavý detail, protože výsledná hra nevznikala pouze psaním kódu. Model kombinoval programování s generováním grafických podkladů.
Chyba s obříma očima
Ne všechno fungovalo správně.
Jedna z postav měla výrazně zvětšené oči. Codex tuto chybu neodhalil ani při prohlížení screenshotů.
Simon ji nakonec opravil dvěma dalšími prompty.
To je praktická připomínka, že ani agent, který dokáže projekt samostatně vytvářet a vizuálně kontrolovat, nemusí spolehlivě rozpoznat všechny chyby.
Co z experimentu plyne
Moonlight & Mayhem není důkazem, že GPT-5.6 Sol obecně navrhuje lepší hry než Claude Fable 5.
V tomto konkrétním pokusu ale Simon preferoval výsledek Codexu a považoval ho za lepší zachycení původního konceptu Raccoon Heist.
Zajímavější než samotné porovnání modelů je možnost projít celý transcript a sledovat, jak agent během necelé hodiny kombinuje kódování, generování assetů, testování a opravy.