Jak modely Claude a GPT zpracovávají znalosti a časové osy trénování

Článek analyzuje, jak jazykové modely jako Claude a GPT získávají a ztrácejí znalosti během trénování.

11. srpna 2026

Článek se zaměřuje na analýzu, jak jazykové modely jako Claude a GPT získávají a ztrácejí znalosti během trénování. Důležitým aspektem této analýzy jsou časové osy znalostí modelů, které nám mohou poskytnout cenné informace o tom, jak byly tyto modely trénovány.

Trénink jazykových modelů obvykle probíhá ve třech fázích: pre-trénink, doménově specifický trénink a post-trénink. Pre-trénink je klíčovým a datově náročným krokem, kdy se model učí na rozsáhlých datech z internetu. Tento proces zahrnuje generování pre-tréninkového checkpointu, což je zásadní pro další fáze trénování.

Podle analýzy efektivních dat znalostí modelů se ukazuje, že modely Anthropic, konkrétně Opus 4.7 a novější, mají odhadované datum cutoff kolem konce prosince 2025. Na druhé straně, rodina modelů GPT-5.6 pochází z vlastního checkpointu, který byl dokončen kolem konce února 2026. Tyto informace ukazují, jak se modely vyvíjejí a jaké znalosti mohou mít na základě dat, na kterých byly trénovány.

Zajímavé je, že model Opus 5 má publikovaný spolehlivý cutoff znalostí k datu květen 2026, ale nevykazuje žádné nové znalosti ve srovnání s modely, které měly cutoff v lednu 2026. To naznačuje, že i když byl model trénován na novějších datech, jeho schopnosti se nezměnily.

Dalším důležitým faktorem je, že self-reported dates (datum, které modely uvádějí) se poměrně dobře shodují s faktickými odhady. To naznačuje, že modely mají určitou schopnost reflektovat časové osy, na kterých byly trénovány. Například modely OpenAI se nikdy neidentifikují jako modely jiných laboratoří, zatímco modely Anthropic, jako je Sonnet 5, se často identifikují jako GPT-4. To může naznačovat, že modely Anthropic byly trénovány na datech, která obsahovala interakce s uživateli ChatGPT.

Vzhledem k tomu, že modely trénované na interakcích s uživateli mohou zahrnovat zaujatosti z těchto interakcí, je důležité brát v úvahu, jaký vliv mají uživatelské vstupy na trénink modelů.