NVIDIA 1. jūlijā publicēja Nemotron-Labs-TwoTower — atvērtu difūzijas valodas modeli, kas standarta izvietošanā sasniedz 2,42 reizes lielāku teksta ģenerēšanas caurlaidspēju nekā tā autoregresīvais pamats, saglabājot 98,7% no tā vidējo etalonu rezultātiem. Modeļa svari ir publicēti Hugging Face zem NVIDIA Nemotron Open Model licences.
Lielāko daļu LLM inference izmaksu nosaka ģenerēšanas ātrums: jo lēnāk modelis ražo tokenus, jo vairāk GPU laika vajag katram vaicājumam. Tradicionālie modeļi — GPT sērija, Llama, Mistral — darbojas autoregresīvi un ģenerē vienu tokenu aiz otra, katru balstot uz iepriekšējiem. Difūzijas modeļi sāk ar trokšņainu tokenu bloku un iteratīvi to attīra. Viens GPU cikls var producēt vairākus tokenus vienlaicīgi.
Divu torņu arhitektūra
TwoTower uzbūvēts uz Nemotron-3-Nano-30B-A3B pamata — hibrīda arhitektūras, kas apvieno Mamba-2 slāņus, pašuzmanību un ekspertu maisījumu (MoE). No tā izaug divi torņi.
Pirmais — iesaldētais autoregresīvais konteksta tornis — apstrādā jau ģenerētos tokenus ar kauzālu uzmanību, tāpat kā tradicionāls LLM. Otrais — apmācāmais difūzijas denoiser tornis — saņem no pirmā kontekstu caur šķērsuzmanību un vienlaicīgi attīra trokšņainu tokenu bloku ar divvirzienu bloka uzmanību. Pirmais tornis seko koherencei ar rakstīto; otrais ģenerē nākamo bloku.
Abi torņi kopā sver aptuveni 60 miljardus parametru (pamata — 30 miljardi). NVIDIA modeļa kartē Hugging Face norāda:
TwoTower ģenerē tekstu, iteratīvi attīrot tokenu blokus paralēli — nevis vienu tokenu reizē.
Šī arhitektūra ļauj pamata AR torni atstāt neskartu. Kompānijai ar jau apmācītu LLM difūzijas ģenerēšanu var pievienot, apmācot tikai denoiser torni uz daļu no sākotnējā datu budžeta.
Veiktspējas skaitļi
Pēc MarkTechPost analīzes, 2,42× pieaugums ir sienas pulksteņa laiks standarta izvietošanā uz H100 GPU, nevis teorētisks tokenu skaits. Vispārīgā zināšanu etalona daļa atpaliek no AR pamata par mazāk nekā vienu punktu. Kods un matemātika uzrāda nelielu pasliktināšanos; veselais saprāts un daudzvalodīgums sasniedz vai pārsniedz pamatu.
Pilnam divu torņu difūzijas ģenerēšanas režīmam vajadzīgas divas GPU ar aptuveni 59 gigabaitiem katra BF16 precizitātē — parasti divas H100 vai A100 80 GB kartes. Vienas GPU konfigurācijā modelis darbojas autoregresīvā torņa režīmā, bet tad caurlaidspējas priekšrocība nepastāv.
Spekulatīvā dekodēšana (speculative decoding) arī paātrina autoregresīvos modeļus ar nelielu melnraksta modeli, ko verificē lielais. Tam vajadzīgs atsevišķs melnraksta modelis un kalibrācija. TwoTower izmanto pašu denoiser torni kā melnrakstu — abi komponenti iegūti no vienas apmācības.
Apmācības apjoms
Pamata tornis apmācīts no nulles uz aptuveni 25 triljoniem tokenu divās pakāpēs ar nākamā tokena prognozēšanas mērķi. Denoiser tornis apmācīts uz aptuveni 2,1 triljoniem tokenu ar masētas difūzijas mērķi, sekojot pamata modeļa datu plānam. Datu pirmkopijas datums — 2025. gada 25. jūnijs.
Tie 2,1 triljons tokenu ir aptuveni 8% no pamata apmācīšanas apjoma. Ja labs AR modelis jau eksistē, difūzijas tornis ir salīdzinoši lēts papildinājums.
Konteksts NVIDIA difūzijas modeļu sērijā
Tajā pašā mēnesī NVIDIA izlaida arī Nemotron-Labs-Diffusion — trīs režīmu difūzijas modeli, kas uz GB200 GPU sasniedz 6× vairāk tokenu per forward pasu nekā Qwen3-8B. TwoTower atšķiras: tā AR konteksta tornis paliek iesaldēts, bet Nemotron-Labs-Diffusion ir tīri difūzijas arhitektūra, apmācīta no nulles.
Pilni etaloni un arhitektūras pamatojums publicēti pētnieku rakstā arXiv.
Avoti
- NVIDIA Releases Nemotron-Labs-TwoTower — MarkTechPost, 01.07.2026.
- Nemotron-Labs-TwoTower-30B modeļa karte — Hugging Face
- Nemotron-Labs-TwoTower: Diffusion Language Modeling with Pretrained Autoregressive Context — arXiv
- NVIDIA Diffusion LLM Hits 2.42x Throughput Without Retraining — TechTimes, 02.07.2026.
Komentāri
Šim rakstam vēl nav komentāru. Esi pirmais, kurš dalās ar savu viedokli.