Google DeepMind udostępnił DiffusionGemma, eksperymentalny otwarty model językowy, który generuje tekst metodą dyfuzji zamiast klasycznego przewidywania słowo po słowie. Według Google nowe podejście przyspiesza generowanie nawet czterokrotnie. Model trafił od razu na Hugging Face, na otwartej licencji Apache 2.0.
Tradycyjne modele językowe działają jak maszyna do pisania: tworzą tekst token po tokenie, od lewej do prawej. DiffusionGemma generuje całe bloki naraz. W jednym przejściu produkuje do 256 tokenów równolegle, a dzięki dwukierunkowej uwadze każdy token bierze pod uwagę pozostałe. Model iteracyjnie oczyszcza wstępne, zaszumione tokeny aż do gotowej odpowiedzi, podobnie jak modele dyfuzyjne budują obraz ze startowego szumu. To inny tor rozwoju niż dominujące dziś modele autoregresywne.
Pod maską to architektura Mixture of Experts o 26 mld parametrów, z których podczas inferencji aktywnych jest 3,8 mld. Przekłada się to na ponad 1000 tokenów na sekundę na układzie NVIDIA H100 i ponad 700 tokenów na sekundę na konsumenckiej karcie RTX 5090. Po kwantyzacji model mieści się w 18 GB pamięci VRAM, więc da się go uruchomić na mocniejszym domowym lub firmowym sprzęcie. Obsługują go już MLX, vLLM oraz Hugging Face Transformers, a wsparcie dla llama.cpp jest zapowiedziane. Wdrożenie w chmurze umożliwiają Google Cloud i NVIDIA NIM.
Co to oznacza dla polskiego biznesu? Szybsza inferencja to niższy koszt jednostkowy działania asystentów i agentów AI, bo ten sam serwer obsłuży więcej zapytań. Otwarta licencja i niskie wymagania sprzętowe ułatwiają uruchomienie modelu lokalnie, bez stałych opłat za API. Dla firm pracujących na danych wrażliwych, takich jak kancelarie, podmioty medyczne czy działy finansowe, self-hosting na własnym GPU oznacza, że dane nie opuszczają firmowej infrastruktury. Trzeba jednak pamiętać, że DiffusionGemma jest na razie modelem eksperymentalnym. Zanim trafi do produkcji, warto sprawdzić jakość jego odpowiedzi na własnych zadaniach i porównać ją z dotychczasowymi modelami.
Źródło: Google — The Keyword (EN), 10 czerwca 2026.



