Přeskočit na obsah
Čísla 3 min čtení

Pew našel stopy AI v desetině anglického webu, u novějších stránek ve více než třetině

Pew Research Center prověřil 490 000 anglických webových stránek a v červencovém vzorku našel významné stopy strojového autorství u 10 % z nich. Mezi stránkami s datem vydání po spuštění ChatGPT podíl vystoupal na 35 %. Detektor však neumí spolehlivě určit autora jednoho konkrétního textu.

Ruka píše poznámky do sešitu vedle otevřeného notebooku
U jednoho textu nelze z jazykových znaků bezpečně určit, jestli ho napsal člověk, nebo model. Foto: Shixart1985, Wikimedia Commons (CC BY 2.0)

Pew Research Center zveřejnil 20. srpna výsledek měření nad 490 000 anglickými webovými stránkami. V každém ze 49 snímků archivu Common Crawl od ledna 2021 do července 2026 vybral náhodně 10 000 stránek a jejich text předložil detektoru. V posledním vzorku překročilo zvolenou hranici pro významné stopy autorství nebo úprav pomocí AI 10 % stránek.

Desetina neznamená, že výzkumníci našli autora každého dokumentu. Model hledá statistické vzorce ve slovníku a stavbě vět. Výsledek jedné stránky může být chybný; smysl měření je ve srovnání stejně zpracovaných velkých vzorků v čase.

Deset procent a 35 procent má jiný jmenovatel

Common Crawl obsahuje staré i nové stránky. Velká část červencového vzorku tedy vznikla dřív, než OpenAI 30. listopadu 2022 zpřístupnila ChatGPT. Proto Pew spočítal ještě druhý podíl: mezi stránkami s dohledatelným datem vydání po tomto dni našel stopy AI u 35 %.

Právě tady je omezení, které se z jednoho čísla ztratí. Datum vydání má v HTML jen 10 až 15 % stránek z každého vzorku a nejde o náhodný výběr webu. Metodika Pew proto vztahuje 35 % pouze na datované stránky, nikoli na všechen nový obsah. Ve vzorku navíc chybějí nebo jsou slabě zastoupené weby za přihlášením a platební zdí, protože Common Crawl se k nim nedostane.

Nezávislá studie našla stejný podíl v jiném archivu

Číslo má jednu užitečnou vnější kontrolu. Čtveřice výzkumníků z Imperial College London, Internet Archive a Stanfordovy univerzity v dubnu zveřejnila práci The Impact of AI-Generated Text on the Internet. Z Wayback Machine sestavila vlastní vzorek webů vydaných mezi lety 2022 a 2025. V polovině roku 2025 označil jejich detektor za vytvořené nebo upravené pomocí AI zhruba 35 % nově publikovaných webů.

Obě hodnoty nelze složit do jedné časové řady. Pew počítá jednotlivé stránky s uvedeným datem, druhá skupina weby a používá jiný archiv i výběr. Shoda ukazuje, že podíl je řádově kolem třetiny. Přesnost na desetiny procenta z ní neplyne. Nezávislost má navíc hranici: dubnová studie vybrala po porovnání čtyř nástrojů Pangram v3 a Pew použil otevřený model editlens_Llama-3.2-3B od téže firmy.

Otevřený a placený detektor se shodly v 96 % případů

Pew označil za významnou stopu skóre od 0,2 na stupnici od nuly do jedné. Hranici nastavil tak, aby se výsledky otevřeného modelu přiblížily placenému Pangram 3.3. Na 62 370 stránkách ze sedmi snímků se oba detektory shodly v 96 % případů; Cohenovo kappa, které počítá i shodu vzniklou náhodou, vyšlo 0,61.

Rozdíl byl vidět hlavně před příchodem ChatGPT. Placený model tam odhadoval téměř nulový výskyt, otevřený přibližně jedno procento. Autoři z toho usuzují na vyšší podíl falešných poplachů otevřeného modelu ve starších textech. Sami proto varují, že klasifikace jedné stránky není konečný verdikt o jejím autorství.

Stopy AI rostou hlavně na doménách .com

Rozdíl není po webu rozložený rovnoměrně. V šestiměsíčních průměrech pro rok 2026 neslo stopy AI 9,35 % stránek na doménách .com a 4,59 % na .org. U .edu to bylo 1,03 % a u .gov 0,76 %. Data ukazují rozdíl mezi skupinami domén, ne jeho příčinu; z měření nelze rozhodnout, zda za ním stojí druh obsahu, odlišné publikační nástroje, nebo skladba archivu.

Dlouhá pomlčka je častější, důkaz autorství z ní není

Pew vedle skóre detektoru počítal i jednotlivé jazykové návyky. Na 10 000 slov připadalo v lednu 2023 v průměru 5,79 dlouhé pomlčky, v lednu 2026 už 11,19. Anglická čárka před poslední spojkou ve výčtu, známá jako Oxford comma, vzrostla z 34,04 na 55,51 výskytu. Vybraná slova oblíbená jazykovými modely se objevovala více než dvakrát častěji.

Stejné prostředky používají i lidé. Samotná pomlčka, čárka nebo slovo proto nikoho neusvědčuje a Pew je ani nevydává za seznam zakázaných znaků. Ke stažení nabízí tabulky pro popis celého vzorku. Právě tam nové měření něco říká: během tří let se proměnil slovník i interpunkce anglického webu, ale podpis konkrétního autora z nich přečíst nelze.

Zdroje: výsledky Pew Research Center, metodika analýzy, studie Dolezala a spoluautorůjejí data a grafy.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Čísla

    Známku ověřeného měření nemá ani jeden z 2 542 výsledků v žebříčcích Hugging Face

    Hugging Face ukládá od prosince 2025 výsledky testů přímo do repozitáře modelu a skládá z nich žebříčky benchmarků. Ze 2 542 položek, které v nich 4. září 2026 stály,…

  2. Čísla

    Experti uložení po čtyřech bitech tvoří 94 % vah DeepSeeku V4 Flash Vision

    DeepSeek nahrál 31. srpna 2026 na Hugging Face váhy experimentálního modelu DeepSeek-V4-Flash-Vision-Exp. Osmačtyřicet souborů má dohromady 167,8 GB a 93,8 % z toho…

  3. Čísla

    Zrychlení jádra Qwen-Image se v celém požadavku neprojevilo

    SGLang sloučil závěrečnou normalizaci a modulaci obrazového modelu Qwen-Image do jediného jádra. Samotná operace zrychlila podle délky vstupu 3,1krát až 5,6krát, deset…

  4. Čísla

    Sada Monsoon ukázala větší rozdíly mezi regiony Indie než mezi osmi modely přepisu řeči

    Hugging Face a Voice Arena přidaly do žebříčku Open ASR Leaderboard sady Monsoon pro indickou angličtinu a hindštinu. Každý klip v nich nese dvanáct údajů o mluvčím, a…