Qwen3.8 27B pilnajā BF16 precizitātē aizņem 55 GB. Q4_K_M variantā tie ir 17 GB. Uz agentu kodēšanas testa Terminal-Bench 2.1 abi nokārto vienādu uzdevumu daļu, aptuveni 75 % no 89 uzdevumiem. Skaitli publicēja Quesma komanda, kas izmērīja piecus kvantizācijas līmeņus un par GPU nomu samaksāja ap 3000 dolāru.
Līdz šim izvēle starp Q4 un Q8 balstījās sajūtās un forumu ierakstos. Tagad ir cipari. Tie ir diezgan mierinoši visiem, kam serverī stāv viena 24 gigabaitu karte.
Ko tieši mērīja
Testā piedalījās Unsloth sagatavotie GGUF faili: BF16 ar 55 GB, Q8_0 ar 29 GB, Q4_K_M ar 17 GB, UD-Q2_K_XL ar 10,7 GB un UD-IQ1_S ar 6,2 GB. Dzinējs bija llama.cpp. Dzelzs sastāvēja no NVIDIA L40S ar 48 GB atmiņas, H100 ar 80 GB un H200 ar 141 GB, viss nomāts caur Modal.
Uzdevumu komplekti bija trīs. GPQA Diamond ar universitātes līmeņa dabaszinātņu jautājumiem, IFBench instrukciju precīzai izpildei un Terminal-Bench 2.1, kur modelim pašam jādarbina komandas termināļa sesijā.
UD priedēklis nosaukumos nozīmē Unsloth dinamisko kvantizāciju. Tā nesaspiež visus slāņus vienādi. Uzmanības slāņi un iegulšanas tabulas paliek augstākā precizitātē, pārējais tiek saspiests agresīvāk. Tieši tāpēc 10,7 gigabaitu variants vispār spēj sekot instrukcijām, kamēr vienmērīga divu bitu saspiešana parasti sabojā modeli pilnībā.
Četri biti iztur
Q4_K_M nezaudēja nekur. GPQA Diamond pilnais modelis augstākajā domāšanas režīmā sasniedza ap 95 %. Q4_K_M rezultāts bija tāds pats. IFBench neuzrādīja mērāmu kritumu pat divu bitu variantā. Terminal-Bench 2.1 Q4_K_M atkārtoja BF16 rezultātu.
Divu bitu UD-Q2_K_XL sāka atpalikt. Terminal-Bench 2.1 tas nokārtoja ap 68 % uzdevumu pret 75 % pilnajam modelim. Tas arī patērēja par 25 % vairāk izvades žetonu, lai izdarītu to pašu darbu. Ietaupītā atmiņa daļēji atgriežas kā ilgāks gaidīšanas laiks.
Viens bits pārstāj strādāt
UD-IQ1_S ar 6,2 GB uz GPQA Diamond nokrita līdz aptuveni 25 %. Tests ir ar četriem atbilžu variantiem, tātad 25 % nozīmē minēšanu. Fails joprojām ielādējas un ģenerē tekstu, bet uz zināšanu jautājumiem tas netrāpa biežāk par nejaušu izvēli.
Neatkarīgs GGUF salīdzinājums vietnē kingy.ai to pašu robežu parāda citādi. Tur mēra top-1 sakritību ar BF16 izvadi: IQ2_S dod 87,18 %, IQ3_S 92,41 %, Q4_K_XL 96,02 % un Q6_K 97,93 %. KL diverģence pret oriģinālu Q8_0 gadījumā ir 0,00064, IQ2_S gadījumā jau 0,09832. Starpība ir vairāk nekā simtkārtīga.
Ko izvēlēties konkrētai kartei
Q4_K_M ar 17 GB ietilpst RTX 4090 atmiņā un atstāj vietu aptuveni 64 tūkstošiem žetonu konteksta. KV kešatmiņa F16 formātā prasa 2,3 GB uz katriem 32 tūkstošiem žetonu, tāpēc gara konteksta rēķins aug ātri. Deklarētie 262 tūkstoši žetonu paņem ap 16 GB tikai kešatmiņai, pirms modelis vispār ir ielādēts.
- 16 GB karte: IQ3_S ar 13,84 GB, atliek vieta 8 tūkstošu žetonu kontekstam
- 24 GB karte: Q4_K_M vai UD-Q4_K_XL, 17 līdz 18 GB
- 32 GB karte: Q6_K ar 22,43 GB
- 48 GB un vairāk: Q8_0 ar 28,89 GB, kur atšķirība no oriģināla praktiski pazūd
Vidusceļš starp trim un četriem bitiem ir tas, kur kvalitāte sāk krist redzami. IQ3_S KL diverģence pret oriģinālu ir 0,03247 pret aptuveni 0,01 četru bitu variantam. Praksē tas nozīmē retākus, bet pamanāmus pārpratumus garākos kodēšanas uzdevumos.
Domāšanas režīms maksā vairāk nekā kvantizācija
Qwen3.8 27B pēc noklusējuma strādā xhigh domāšanas režīmā. Simons Vilisons pārbaudīja, ko tas nozīmē praksē. Uzdevums uzzīmēt apli SVG formātā izraisīja 22 276 domāšanas žetonus un 21 minūti darba. Ar izslēgtu domāšanu tas pats uzdevums aizņēma 137 sekundes un 3715 žetonus.
Sāciet ar Qwen 3.8 27B zemā domāšanas režīmā vai pavisam bez tā.
Vilisons to raksta pēc mērījumiem LM Studio, kur modelis deva 15 līdz 30 žetonus sekundē. Multi-Token Prediction optimizācija šo skaitli palielināja par aptuveni 72 %. Salīdzinājumam: viena kvantizācijas pakāpe no Q8_0 uz Q4_K_M nogriež 12 GB atmiņas, bet neko nemaina atbilžu kvalitātē.
Kad lētāk ir pirkt API
Quesma rēķini rāda arī otru pusi. Pašu darbināta Qwen3.8 27B izvades žetons nomātā GPU izmaksāja 3 līdz 5 dolārus par miljonu. DeepSeek V4 Flash tajā pašā laikā maksā ap 0,1 dolāra par miljonu žetonu. Viena Terminal-Bench 2.1 palaišana visiem kvantizācijas līmeņiem izmaksāja 2308 dolārus, GPQA un IFBench kopā vēl 663.
Vietnes BenchLM apkopojumā Qwen3.8 27B ar 64,42 punktiem ierindojas 39. vietā starp 412 modeļiem. Konteksta logs ir 262 tūkstoši žetonu. Modelis ir Apache 2 licencē un pieņem attēlus, tāpēc lokāla darbināšana joprojām ir pamatota tur, kur dati nedrīkst aiziet ārpus uzņēmuma. Rēķins par žetonu tad ir 30 līdz 50 reizes lielāks.
Komentāri
Šim rakstam vēl nav komentāru. Esi pirmais, kurš dalās ar savu viedokli.