Google predstavil DiffusionGemma, experimentálny jazykový model, ktorý nejde cestou klasického generovania "token po tokene". Namiesto toho vytvorí naraz celý blok textu a v ďalších krokoch ho postupne upravuje, čo prináša výrazný nárast rýchlosti, ale aj viditeľný ústup v kvalite výstupu.
Model je dostupný ako open source pod licenciou Apache 2.0 a Google ho cieli na vývojárov a výskumníkov. Nejde teda o náhradu bežných chatovacích modelov, ale o nástroj, ktorý skúša iný spôsob generovania textu s dôrazom na efektivitu a odozvu.
Od autoregresie k "draftu" celého bloku
Bežné veľké jazykové modely, vrátane Gemma 4, skladajú odpoveď postupne: každý ďalší token závisí od predchádzajúcich. Takýto postup je prirodzene sekvenčný, a preto sa ťažšie urýchľuje aj na výkonnom hardvéri.
DiffusionGemma začína opačne: vytvorí plátno náhodných tokenov, ktoré pripomína šum a nedáva zmysel. V niekoľkých prechodoch ho potom čistí a spresňuje, až kým sa neustáli finálna odpoveď. Kým klasické modely skôr "píšu", DiffusionGemma naraz načrtne celý text a následne ho upravuje.

Rýchlosť a efektivita
Zmena generovania má priamy dopad na výkon. Google tvrdí, že v scenároch s nízkou mierou súbežnosti (keď GPU obsluhuje jedného používateľa alebo proces) môže byť DiffusionGemma až štvornásobne rýchlejšia než štandardné autoregresívne modely.
Firma zároveň uvádza konkrétne čísla na výkonných kartách: viac než 1 000 tokenov za sekundu na NVIDIA H100 a cez 700 tokenov za sekundu na RTX 5090. Práve takýto typ metrík naznačuje, že model mieri na použitia, kde je dôležitejšia okamžitá odozva než maximálne uhladený text.
Technické parametre a čo umožňujú v praxi
Google opisuje DiffusionGemma aj cez architektúru a spôsob výpočtu, ktoré majú držať nároky na hardvér na uzde.
- Mixture-of-Experts model s 26 miliardami parametrov
- Pri inferencii sa aktivuje približne 3,8 miliardy parametrov
- Generovanie až 256 tokenov paralelne v jednom kroku
- V rámci bloku môže každý token „vidieť“ všetky ostatné tokeny
- Po kvantizácii má mať pamäťovú stopu okolo 18 GB VRAM a cieľom sú aj výkonnejšie spotrebiteľské GPU
Podstatné je najmä paralelné generovanie a globálny pohľad na celý blok textu, keďže to mení správanie modelu: nepostupuje striktne lineárne a vie pracovať s konzistenciou v rámci jedného kroku generovania.
Vhodné úlohy a priznanie slabšej kvality oproti Gemma 4
Google vyzdvihuje, že tento spôsob generovania lepšie sedí na štruktúrované alebo pravidlami viazané zadania. Model má pomáhať napríklad pri dopĺňaní chýbajúcich častí kódu, dokončovaní štruktúrovaných formátov typu JSON, riešení logických úloh v štýle sudoku alebo pri matematických vzoroch, kde je dôležitá konzistencia naprieč celým výstupom.

Nemali by ste prehliadnuť:
- YouTube na pozadí bez Premium v roku 2026: Ktoré triky ešte fungujú?
- Google Fotky chystajú priame kopírovanie fotiek do schránky
- Pokuty za mobil, nové Xiaomi, nebezpečná Meta AI aj veľké novinky pre Android | Prehľad týždňa

Spolu s tým však prichádza aj hlavný kompromis, na ktorý Google otvorene upozorňuje: DiffusionGemma nedosahuje kvalitu výstupu štandardných modelov Gemma 4. Text môže byť menej stabilný, menej "vybrúsený" a pri komplexných či nuansovaných odpovediach menej spoľahlivý. Aj preto ho Google rámcuje ako experiment pre real-time nástroje, inline asistentov pri písaní a programovaní či rýchle iteratívne workflow, kde je priorita rýchlosť nad finálnou kvalitou.