Krádež myšlenkových stop z proprietárních LLM API

Článek se zaměřuje na techniky krádeže myšlenkových stop z API velkých jazykových modelů a jejich bezpečnostní implikace.

12. srpna 2026

V poslední době se objevily techniky krádeže myšlenkových stop z proprietárních API velkých jazykových modelů (LLM), které mohou mít vážné důsledky pro bezpečnost těchto systémů. Podle článku se společnosti jako Anthropic, OpenAI a Google rozhodly vracet klientům šifrované bloky myšlení, které lze přehrávat napříč relacemi, uživateli a modely. Tato metoda umožňuje útočníkům získat skryté myšlení silnějších modelů.

Autoři studie zjistili, že každý model v rámci stejné rodiny používá stejný šifrovací klíč. To znamená, že útočníci mohou vzít šifrované bloky z jednoho modelu a použít je k "jailbreaku" slabších modelů, což jim umožní získat nešifrované myšlenkové stopy. Claude Haiku 4.5 byl identifikován jako nejjednodušší model k útoku.

Jedním z objevů studie byla varianta injekce promptu, která umožňuje modelu přemýšlet o exfiltraci dat. Tato technika zahrnuje manipulaci s myšlenkovými stopami modelu tak, aby se zamyslel nad nahráváním dat na vzdálený server.

Všechny modelové poskytovatele potvrdili přijetí zprávy o zranitelnosti a podle dostupných informací již nebylo možné tyto útoky provádět. To ukazuje, že společnosti reagují na bezpečnostní hrozby, ale také naznačuje, že zranitelnosti v těchto systémech mohou být stále přítomny a vyžadují neustálou pozornost.

Zajímavé na tom je, že tyto techniky odhalují, jak důležité je zabezpečení myšlenkových stop v LLM. Jakmile se jednou útočníkovi podaří získat přístup k těmto informacím, může to mít dalekosáhlé důsledky pro důvěrnost a integritu dat.