Detektors, kas kalibrēts akadēmiskam tekstam, atrada AI rakstīšanas pazīmes 65 % datorzinātnes rakstu, kas pēdējos divpadsmit mēnešos nonākuši preprintu arhīvā arXiv. Tas pats detektors matemātikas rakstos atzīmēja 0,7 %. Skaitļus 12 750 rakstu izlasē apkopoja komanda aiz rīka unslop un izklāstīja publikācijā par mērījumu un tā robežām.
Izlase aptver desmit nozaru grupas, aptuveni 25 rakstus katrā nozarē mēnesī, no 2023. gada janvāra līdz 2026. gada jūlijam. Kā atskaites punktu komanda pievienoja 2021. un 2022. gada rakstus, kas sarakstīti pirms ChatGPT. Tajos detektors iezīmēja stabilus 0,4 %. Pēc ChatGPT parādīšanās skaitlis sāka kāpt jau dažu mēnešu laikā un divos viļņos sasniedza aptuveni 32 % pēdējā pilnajā ceturksnī, ar maksimumu tuvu 39 % 2026. gada sākumā.
Kā detektors nolasa rakstu
Detektors lasa raksta pilno tekstu. Kopsavilkumu komanda apzināti izlaida, jo īsais teksts signālu novājina. Slieksni pētnieki uzstādīja tā, lai uz rakstiem pirms lielo valodas modeļu ēras kļūdaini iezīmētu 0,4 % — tik daudz ir viltus pozitīvo. Pie šī sliekšņa detektors iztur 99,6 % īsta pirms-LLM zinātniskā teksta un atpazīst 85 % AI rakstīta akadēmiskā teksta.
No tā izriet divas lietas. Izmērītais rādītājs ir zemākā robeža: patiesā daļa ir vismaz tik liela, cik detektors saskaitīja. Un iezīmēts raksts vēl nepierāda autorību — rīks neatšķir viegli rediģētu tekstu no pilnībā ģenerēta.
Kontroles gadi ir mērījuma stiprākā daļa. Ja detektors 2021. un 2022. gada rakstos būtu iezīmējis, teiksim, 15 %, tas nozīmētu, ka rīks reaģē uz pašu akadēmisko stilu, un vēlākie skaitļi neko neizteiktu. Stabilie 0,4 % pirms ChatGPT rāda, ka bāze ir zema un vēlākais kāpums ir īsts, ne trokšņa artefakts.
Kur nozares atšķiras
Pēdējo divpadsmit mēnešu dati līdz 2026. gada jūlijam rāda plašu izkliedi starp laukiem:
- datorzinātne — 65,0 %
- kvantitatīvā bioloģija — 56,3 %
- elektrotehnika un sistēmas — 51,3 %
- ekonomika un finanses — 47,0 %
- lietišķā fizika — 34,0 %
- statistika — 31,3 %
- matemātika — 0,7 %
Datorzinātnes pirmā vieta nav pārsteigums. Šīs jomas autori valodas modeļus izmēģināja vieni no pirmajiem, un lielākā daļa rakstu ir angliski, kas ir modeļu spēcīgākā valoda. Matemātikas zemais skaitlis savukārt daļēji izriet no mērījuma robežām. Matemātikas rakstus pārsvarā veido notācija un teorēmu–pierādījumu struktūra, un uz šāda teksta detektors strādā neuzticami. Starpība starp augšējo un apakšējo lauku tomēr paliek liela — gandrīz simtkārtīga.
Kur mērījums kļūst nedrošs
Bez matemātikas problēmas autori norāda vēl vienu: detektors ir jutīgāks pret vieniem teksta ģeneratoriem nekā citiem. Ja raksts rakstīts ar modeli, ko rīks pazīst vājāk, tas var paslīdēt garām. Tāpēc komanda savu skaitli formulē kā apakšējo robežu, nevis kā precīzu īpatsvaru.
Izmērītā daļa ir zemākā robeža. Detektors dažus ģeneratorus atpazīst labāk nekā citus, tāpēc patiesais AI teksta īpatsvars ir vismaz tik liels, cik parādīts skaitļos.
Praksē tas nozīmē, ka 65 % datorzinātnē var būt pieticīgs lasījums. Bet tas neļauj arī otrādi teikt, ka konkrētu rakstu sarakstījusi mašīna — detektors mēra tekstā esošo signālu, ne autora nodomu.
Skaitlis attiecas uz arXiv, kas ir preprintu arhīvs. Raksti tur parādās pirms recenzēšanas žurnālā, tāpēc teksts nonāk pie lasītājiem un meklētājiem uzreiz, bez redakcijas filtra. Tas padara arXiv par ērtu mērīšanas vietu un vienlaikus par vietu, kur neatklāts AI teksts izplatās ātri.
Ko rāda citi pētījumi
Līdzīgu kāpumu agrāk fiksēja Stenfordas Universitātes pētnieku grupa. Darbā Mapping the Increasing Use of LLMs in Scientific Papers tā analizēja 950 965 rakstus no arXiv, bioRxiv un Nature žurnāliem laikā no 2020. gada janvāra līdz 2024. gada februārim. Datorzinātnes kopsavilkumos LLM ietekmēto teikumu daļa sasniedza 17,5 %, bet uz fiziku un Nature žurnāliem izplatījās lēnāk.
Skaitļi nav tieši salīdzināmi, jo metodes atšķiras. Rīks unslop vērtē raksta pilnu tekstu ar klasifikatoru, Stenfordas darbs skaita atsevišķu teikumu stilu kopsavilkumos. Abi rāda vienu virzienu — kāpumu tūlīt pēc 2022. gada beigām, kad iznāca ChatGPT.
Trešais mērījums iet vēl plašāk. Decembra pētījumā, kas balstīts Dimensions datubāzē, autori skaita atsevišķu norādošu vārdu pārmērīgu lietojumu visā publicēto rakstu klāstā, arī ārpus arXiv. Viņu vērtējums: valodas modeļi bijuši iesaistīti vairāk nekā 10 % 2024. gadā publicēto rakstu. Tas pats darbs norāda, ka autori LLM lietojumu bieži noklusē vai mazina, un aicina ieviest skaidras atklāšanas prasības.
Tendence sniedzas ārpus datorzinātnes. Atsevišķs 2026. gada medicīnas literatūras pārskats atrod augošu AI ģenerēta teksta īpatsvaru atvērtās piekļuves medicīnas rakstos. Daļa šī teksta atgriežas nākamajos modeļos: arXiv veido aptuveni 2,5 % no Llama, 12 % no RedPajama un 8,96 % no The Pile treniņu datiem. AI rakstīts zinātnisks teksts kļūst par izejmateriālu nākamajai modeļu paaudzei. Jo vairāk tā nonāk arhīvā, jo vairāk tā ieplūst treniņu kopās, no kurām mācās nākamie modeļi.
Avoti
- unslop — How we measured AI writing across arXiv, and where the measurement breaks
- Mapping the Increasing Use of LLMs in Scientific Papers (arXiv)
- Estimating the prevalence of LLM-assisted text in scholarly writing (arXiv)
- Rising Prevalence of Detected AI-Generated Text in Medical Literature (arXiv)
Komentāri
Šim rakstam vēl nav komentāru. Esi pirmais, kurš dalās ar savu viedokli.