Detekce textů generovaných LLM pomocí klasického strojového učení

Osobní experiment ukazuje, jak TF-IDF a LinearSVC rozlišovaly lidské a strojově generované věty v datové sadě čínských webových textů.

17. července 2026

Autor v osobním experimentu testoval, zda lze texty vytvořené jazykovými modely rozpoznávat pomocí klasických metod strojového učení. Zaměřil se především na čínské webové romány a fanfikce, nikoli na obecnou detekci AI textu napříč jazyky a žánry.

Použil reprezentaci TF-IDF a klasifikátory založené na LinearSVC z knihovny scikit-learn. Vytvořil sedm samostatných binárních klasifikátorů. Větu systém označil jako podezřelou, pokud ji jako strojově generovanou vyhodnotily alespoň dva z nich.

Výsledky na autorově testovací sadě

Jednotlivé plné modely dosáhly na testovací sadě přibližně 84 až 89 procent přesnosti. F1 skóre se podle zdroje pohybovalo přibližně od 0,81 do 0,90.

Výsledky se vztahují k autorově datové sadě. Lidské texty pocházely převážně z čínských webových textů publikovaných mezi lety 2010 a 2022. Syntetické vzorky vznikly regenerováním obsahu pomocí několika jazykových modelů, včetně modelů Gemini a Qwen.

Nejde o nezávislý benchmark. Výsledky proto nelze automaticky vztahovat na češtinu, angličtinu, odborné texty nebo budoucí modely.

Testy modelů mimo trénovací data

Autor nástroj vyzkoušel také na několika výstupech modelů, které nebyly součástí trénovacích dat. U ukázky z Claude Sonnet 4.6 označil systém 71,9 procenta textu jako podezřele strojové. U GPT-5.2 šlo o 73,3 procenta.

Další ukázky se pohybovaly přibližně kolem 70 procent, v některých případech nad 90 procent. Tato čísla ale nepředstavují přesnost na reprezentativní testovací sadě. Jde o podíl textu označeného nástrojem v několika demonstračních příkladech.

U jednoho textu z platformy Lofter, který autor osobně považoval za pravděpodobně vytvořený pomocí AI, nástroj označil 83,4 procenta obsahu. Samotné skóre však nepotvrzuje skutečný původ textu.

Falešné detekce

Autor otestoval práh 60 procent na souboru 10 000 delších fanfikcí publikovaných před rokem 2022. Práh překročily čtyři položky, tedy 0,04 procenta souboru.

Podle autora navíc nešlo o běžné povídky, ale o rozcestníky s velkým množstvím odkazů. Výsledek je zajímavý pro tuto konkrétní datovou sadu, nelze jej ale považovat za obecnou míru falešných detekcí.

Experiment ukazuje, že u úzce vymezeného typu textu mohou i klasické modely zachytit některé statistické vzory spojené s generovaným obsahem. Neznamená to však, že nástroj spolehlivě určí autorství jednotlivého textu. Výstup je vhodnější chápat jako pomocný signál než jako důkaz použití jazykového modelu.