GCC vadības komiteja 29. jūlijā plkst. 2:11 pēc Griničas laika apstiprināja politiku, kas kompilatorā vairs neļauj iekļaut ar lielajiem valodas modeļiem rakstītu kodu, ja labojums ir juridiski nozīmīgs. Paziņojumu mailinglistā izsūtīja David Edelsohn. Darba grupu, kas politiku sagatavoja, vadīja Jonathan Wakely.
Politika nosaka trīs lietas. Juridiski nozīmīgus labojumus, kuros ir LLM ģenerēts saturs vai kuri ir atvasināti no LLM ģenerēta satura, GCC noraida. Juridiski nenozīmīgus LLM ģenerētus labojumus pieņem, ja tie atbilst parastajām prasībām un ir skaidri atzīmēti. Testu gadījumus uzturētāji drīkst pieņemt arī tad, ja tie ir juridiski nozīmīgi un pilnībā ģenerēti ar modeli.
Piecpadsmit rindu robeža nāk no FSF vadlīnijām
Vārdu savienojums “juridiski nozīmīgs” GCC nav jauns. Tas nāk no GNU projekta uzturētāju vadlīnijām, kur robeža ir aptuveni 15 rindas koda vai teksta. Mazākus labojumus FSF neuzskata par autortiesību objektu, tāpēc tiem nav vajadzīga ne autortiesību nodošanas veidlapa, ne DCO paraksts. Jaunā politika šo pašu slieksni pārnes uz modeļu izvadi.
Praksē tas nozīmē, ka ar Claude vai GPT uzrakstīta optimizācija, kas pieskaras 40 rindām tree-vect-loop.cc, uz gcc-patches vairs neaizies. Divu rindu drukas kļūdas labojums aizies, ja to atzīmē.
Skaitli 15 pašā dokumentā neatradīsiet. To pirmais mailinglistā norādīja Richard Biener, viens no GCC globālajiem uzturētājiem. Viņš atbildēja Vector inženierim Andrew Teylu, kurš vaicāja, vai kāds vēl esot pārsteigts par politikas stingrību. Teylu to nosauca par “atteikšanos no jebkura ielāpa, kas garāks par 15 rindām”.
“Mani nepārsteidz, ka mēs ieņemam konservatīvu nostāju autortiesību jautājumos. Mani drīzāk pārsteidz, ka atstājam atvērtu pelēko zonu ar juridiski nenozīmīgajiem labojumiem. Minētās 15 rindas nav ciets skaitlis un politikā nav tieši nosauktas.”
Biener otrajā vēstulē tajā pašā dienā pateica skaidrāk, kas viņu neapmierina. Politika noraidīšanu pamato ar juridisko nenoteiktību. Tā neskar to, ko viņš sauc par daudz smagākām problēmām: pārslogotus recenzentus un GCC uzturēšanu ilgtermiņā. Uzturētājam, kas grib ar modeli ātri uztaisīt prototipu, tagad nav skaidrs, kurā pusē robežas viņš atrodas. Biener arī vaicāja, kāda vispār bija darba grupas jēga, ja rezultāts ir tikai paziņojums par neskaidru juridisko situāciju. Darba grupas dalībnieks Arthur Cohen no Embecosm atbildēja, ka atsauksmes ir gaidītas un politika mainīsies.
Ko drīkst darīt joprojām
Aizliegums attiecas uz kodu, kas nonāk repozitorijā. Izpēte, analīze, kļūdu meklēšana un ielāpu recenzēšana paliek neierobežota, kā apraksta LWN. Modeli drīkst lūgt izskaidrot, kāpēc ģenerētais kods sabojā -fstrict-aliasing. Labojums pēc tam jāuzraksta pašam.
Testu izņēmums ir pragmatisks. GCC testu komplektā ir desmitiem tūkstošu failu. Daudzi pārbauda vienu un to pašu konstrukciju ar dažādiem kompilatora karodziņiem, tāpēc to rakstīšana ir mehānisks darbs. Modelis, kas uzraksta 200 rindas gcc.dg pārbaužu jaunam RISC-V paplašinājumam, nedara neko tādu, ko vēlāks autortiesību strīds varētu apgriezt pret projektu.
Trīs projekti, trīs atbildes
GCC lēmums nāk pēc tam, kad divi citi lielie sistēmprogrammatūras projekti izvēlējās pretējo virzienu.
- Linux kodolā aprīlī ienāca
Documentation/process/coding-assistants.rst. Tas AI kodu atļauj.Signed-off-byrindu drīkst pievienot tikai cilvēks, jo tā ir DCO apliecinājums. Rīku nosauc atsevišķsAssisted-by:tags formātāAGENT_NAME:MODEL_VERSION. Atbildība par ielāpu pilnībā paliek iesūtītājam. - QEMU maijā savu pilno aizliegumu atcēla. Paolo Bonzini 28. maijā iesūtītais ielāps atļauj mehāniskas izmaiņas, kļūdu labojumus līdz 20 rindām, kā arī testus un dokumentāciju. Kodola koda daļām joprojām vajag uzturētāja iepriekšēju atļauju. Commit ziņā jāieliek
AI-used-for:rinda, piemēramAI-used-for: tests, docs. - Debian jūlijā par LLM lietošanu balsoja ar četriem variantiem uz vēlēšanu zīmes.
Atšķirība nav tikai stingrībā. Kodols un QEMU liek autoram deklarēt rīku un pēc tam uzņemties atbildību par rezultātu. GCC izvēlas deklarācijai neuzticēties un nogriezt labojumus pēc apjoma. Iemesls ir FSF autortiesību modelis. Projekts, kas gadu desmitiem prasa parakstītas autortiesību nodošanas veidlapas vai DCO, nevar pieņemt kodu, par kura izcelsmi neviens nespēj parakstīties.
QEMU ielāpā Bonzini savu izmaiņu pamatoja ar diviem argumentiem. Juridiskais risks izrādījies mazāks, nekā gaidīts. Pilnu aizliegumu kļuvis grūti aizstāvēt, modeļu spējām augot. GCC divus mēnešus vēlāk nonāca pie pretējā secinājuma.
Kā to vispār pārbaudīs
Šo politiku neviens neieviesīs automātiski. gcc-patches nav rīka, kas atšķirtu modeļa izvadi no cilvēka rakstīta koda. Praktiski politika balstās uz iesūtītāja godīgumu, kad viņš atzīmē, kur izmantojis modeli. Otrs filtrs ir uzturētāja aizdomas recenzijas laikā.
Tas pats caurums ir arī kodola Assisted-by: tagam. Atšķirība ir sekās. Kodolā nedeklarēts AI kods paliek repozitorijā ar cilvēka parakstu. GCC gadījumā tas ir kods, kuram vispār nebija jātiek iekšā, tāpēc tā izņemšana nozīmē gatavas funkcijas atritināšanu.
Darba grupā bez Wakely strādāja Carlos O’Donell, Sudakshina Das, Jason Merrill, Joel Sherrill, Sam James, Robin Dapp un Arthur Cohen. Politikas tekstu paredzēts ievietot GCC mājaslapā. Pagaidām tas ir tikai izmaiņu pieprasījums Sourceware Forge, bet gcc.gnu.org/contribute.html juridisko prasību sadaļā par LLM vēl nesaka ne vārda.
Avoti
- GCC AI Policy Announcement, David Edelsohn, gcc mailinglists, 29.07.2026.
- Richard Biener par 15 rindu slieksni
- Richard Biener par recenzentu pārslodzi
- GCC steering committee announces AI policy, LWN.net
- GCC To Decline Any Significant Contributions Made Via AI/LLMs, Phoronix
- docs/devel: relax policy on AI-generated contributions, qemu-devel
Komentāri
Šim rakstam vēl nav komentāru. Esi pirmais, kurš dalās ar savu viedokli.