A DiffusionGemma a Google DeepMind kísérleti, nyílt forráskódú multimodális modellje, amely a hagyományos tokenenkénti generálás helyett diffúziós eljárást alkalmaz a szövegalkotásra. Ez a architektúra lehetővé teszi, hogy a modell akár négyszer gyorsabban működjön a dedikált GPU-kon, miközben képes szöveges, képi és videós bemenetek egyidejű feldolgozására is.
*Mit tud ez a modell?*
A *DiffusionGemma egy 26 milliárd paraméteres "Mixture-of-Experts" (MoE) modell*, amelynek egyik legnagyobb előnye, hogy a működés során csupán 3,8 milliárd paraméter aktív. Ennek köszönhetően egyetlen 24 vagy 32 GB-os lakossági videókártyán (pl. RTX 4090, 5090) is gond nélkül elfér, hiszen a kvantált (tömörített) verziója mindössze körülbelül 18 GB memóriát igényel.
Multimodális modellként nemcsak szöveget, hanem *képeket és akár 60 másodperces videókat is képes elemezni*. Akár 256 ezer tokenes kontextust tud kezelni, és több mint 140 nyelven lett betanítva. Képes kódírásra, eszközhasználatra (tool calling), és rendelkezik gondolkodási móddal (Thinking Mode) is, amely lehetővé teszi számára, hogy lépésről lépésre végigvezesse a logikai folyamatokat.
*Működési elve érthetően elmagyarázva:*
A hagyományos nyelvi modellek (LLM) úgy működnek, mint egy *írógép*: balról jobbra haladva, szigorúan szavanként (vagy tokenenként) generálják a szöveget, folyamatosan megjósolva a következő szót.
A DiffusionGemma ezzel szemben a képalkotó mesterséges intelligenciákhoz (pl. Stable Diffusion) hasonló elven működik, amit diszkrét diffúziónak neveznek. A működése ahhoz hasonlít, mintha *egyszerre felvázolna egy teljes, 256 szóból álló bekezdést* (ami az első pillanatban csak véletlenszerű zaj és "halandzsa"), majd ezt a blokkot *párhuzamosan, ismétlődő lépésekben (denoising) addig finomítaná és csiszolná, amíg a szöveg teljesen értelmessé és folyékonnyá nem válik*. Miután egy 256 tokenes "vászonnal" (canvas) elkészült, véglegesíti azt, és rátér a következő blokkra.
*Miben jó, miben fejlődött és miért jobb használni, mint más modelleket?*
- Extrém sebesség: A modell áthelyezi a szűk keresztmetszetet a memória-sávszélességről a tiszta számítási kapacitásra. Ennek eredményeként helyi (lokális) futtatás esetén brutálisan gyors: **egy NVIDIA H100-on több mint 1000 tokent, egy RTX 5090-en pedig több mint 700 tokent képes másodpercenként legenerálni**.
- Kiváló a nem-lineáris feladatokban: Mivel a blokk generálása során minden szó "látja" az összes többit (kétirányú figyelem, *bidirectional attention*), a modell **képes a saját hibáit valós időben felismerni és kijavítani**. Emiatt sokkal jobb az olyan feladatokban, mint a meglévő kódok kiegészítése (infilling), a szövegközi szerkesztés, vagy a szigorú szabályokhoz kötött logikai problémák (például egy Sudoku rejtvény) megoldása.
- Jobb hardverkihasználtság: A lokális gépeken futtatott hagyományos modellek gyakran kihasználatlanul hagyják a grafikus kártyát, mert a memóriára várnak. A DiffusionGemma a párhuzamos adatfeldolgozással folyamatosan munkát ad a Tensor magoknak, így maximálisan kihasználja a rendelkezésre álló hardvert.
*Mik a hibái?*
A hatalmas sebességnek komoly ára van: a DiffusionGemma *minősége és ténybeli pontossága jelentősen elmarad a standard autoregresszív modellekétől* (mint amilyen a normál Gemma 4).
- Hajlamos a hallucinációra: Kísérletek alapján a modell bizonyos feladatoknál (például történelmi vagy életrajzi adatoknál) akár hatszor több ténybeli hibát is véthet, mint a sima Gemma 4. Ennek oka, hogy a finomítási folyamat során a szöveg "folyékonyságára" koncentrál; számára egy kitalált név, dátum vagy összeg ugyanúyan jól és folyékonyan hangzik, mint a valós, így gyakran benne hagyja azokat a végleges válaszban.
- Gyengébb logikai és benchmark eredmények: Komplex programozási, matematikai és érvelési teszteken (pl. MMLU-Pro, AIME, LiveCodeBench) alulmarad a hagyományos társával szemben.
*Linkek*
DiffusionGemma: 4x faster text generation: https://blog.google/innovation-and-ai/technology/developers-tools/diffusion-gemma-faster-text-generation/
Hugging Face google/diffusiongemma-26B-A4B-it: https://huggingface.co/google/diffusiongemma-26B-A4B-it
unsloth/diffusiongemma-26B-A4B-it-GGUF: https://huggingface.co/unsloth/diffusiongemma-26B-A4B-it-GGUF
DiffusionGemma - How to Run Locally: https://unsloth.ai/docs/models/diffusiongemma
X Sundar Pichai: https://x.com/sundarpichai/status/2064744343743922189
X Google DeepMind: https://x.com/GoogleDeepMind/status/2064741061352636762
X Unsloth AI: https://x.com/UnslothAI/status/2064743714875220118
X Omar Sanseviero: https://x.com/osanseviero/status/2064741784371057046
Llama.cpp PR DiffusionGemma #24423: https://github.com/ggml-org/llama.cpp/pull/24423
GitHub LLaDA: https://github.com/ML-GSAI/LLaDA
Google Gemma 4 vs. DiffusionGemma: sebesség vagy pontosság?
-
Írta:
YouTube
