NVIDIA opublikowała Nemotron-Labs Diffusion: rodzinę otwartych modeli dyfuzyjnych LLM w wariantach 3B, 8B i 14B parametrów oraz osobny model wizyjno-językowy 8B. Według benchmarków zespołu wariant 8B generuje tekst około 4× szybciej niż porównywalny model autoregresywny (~865 tokenów na sekundę na GPU B200), zachowując przy tym 1,2% wyższą średnią dokładność niż Qwen3 8B. Modele tekstowe trafiły na Hugging Face na licencji Nemotron Open Model License, komercyjnie przyjaznej.
Co zmieniają modele dyfuzyjne
Klasyczne autoregresywne LLM-y (jak GPT czy Llama) generują tekst token po tokenie. Każdy krok wymaga osobnego przejścia przez całą sieć i odczytu wszystkich wag z pamięci GPU. Dla małych batchy to wąskie gardło: karta spędza więcej czasu na operacjach pamięciowych niż na obliczeniach. Nemotron-Labs Diffusion generuje wiele tokenów równolegle w 32-tokenowych blokach i iteracyjnie je poprawia, lepiej wykorzystując przepustowość nowoczesnych GPU. Co istotne: ten sam checkpoint działa w trzech trybach: autoregresywnym (zgodność wstecz), dyfuzyjnym (FastDiffuser) i self-speculation (LinearSpec). Tryb spekulatywny daje nawet 6,4× więcej tokenów na przejście modelu, a wynik pozostaje bezstratny względem trybu AR przy temperaturze 0.
Co to znaczy dla polskich zespołów AI
Dla firm wdrażających własne LLM-y to konkretna oszczędność na infrastrukturze GPU. Tam, gdzie liczy się latencja przy pojedynczym zapytaniu (czaty obsługowe, agenci AI, edycja tekstu w czasie rzeczywistym, generacja kodu), Nemotron-Labs Diffusion 8B może obniżyć koszt jednego tokena nawet kilkukrotnie bez wymiany sprzętu. Otwarta licencja pozwala fine-tunować model na polskich danych i hostować go lokalnie, co jest kluczowe dla branż regulowanych: finanse, ochrona zdrowia, sektor publiczny. Integracja z frameworkiem SGLang ma trafić do głównej gałęzi „wkrótce", na razie wymaga oddzielnego pull requesta. Warto sprawdzić, czy własna ścieżka inferencji w firmie da się przepiąć na ten sam checkpoint w trybie dyfuzyjnym.
Źródło: Hugging Face Blog — Towards Speed-of-Light Text Generation with Nemotron-Labs Diffusion Language Models (23 maja 2026, EN).



