A Google bemutatta a DiffusionGemma kísérleti nyílt modellt, amely a hagyományos, szóról szóra dolgozó nyelvi modellek helyett diffúziós technológiával generál szöveget. A 26 milliárd paraméteres MoE modell — amelyből mindössze 3,8 milliárd aktív egy forward pass során — egyszerre 256 tokent dolgoz fel, és akár négyszer gyorsabb is lehet dedikált GPU-kon.

A DiffusionGemma H100-es kártyán 1000+, RTX 5090-en 700+ tokent generál másodpercenként. A kvantált modell 18 GB VRAM-en is elfér, így fogyasztói szintű GPU-kon futtatható. A kétirányú figyelemmechanizmus különösen előnyös kódkiegészítésnél, sorszerkesztésnél és más, nem lineáris szövegszerkezeteknél.

A Google hangsúlyozza, hogy a modell minősége alacsonyabb a hagyományos Gemma 4-nél, mivel a sebességre és a párhuzamos generálásra optimalizálták. A súlyok Apache 2.0 licenc alatt érhetők el a Hugging Face-en, és a vLLM, az MLX, valamint a Hugging Face Transformers is támogatja.