Google udostępniło Gemma 4 12B — otwarty, multimodalny model AI, który działa lokalnie na laptopie z 16 GB pamięci (VRAM lub zunifikowanej). To jeden z pierwszych modeli tej wielkości z natywną obsługą dźwięku, a całość trafia do firm na licencji Apache 2.0.
Najciekawsza jest architektura. Gemma 4 rezygnuje z osobnych enkoderów dla obrazu i dźwięku. Dane wpływają wprost do rdzenia modelu językowego: obraz obsługuje lekki moduł osadzania oparty na pojedynczym mnożeniu macierzy, a sygnał audio jest rzutowany bezpośrednio do przestrzeni tokenów tekstowych. Efekt jest wymierny. Model z 12 miliardami parametrów osiąga wyniki zbliżone do większego modelu 26B MoE, zużywając mniej niż połowę pamięci. Mechanizm Multi-Token Prediction dodatkowo skraca czas odpowiedzi.
Model jest szeroko dostępny od pierwszego dnia. Pobierzemy go z Hugging Face i Kaggle, uruchomimy w LM Studio, Ollamie, llama.cpp, vLLM czy MLX, a wdrożenie w chmurze obsługują Vertex AI, Cloud Run i GKE. Google dołączyło też repozytorium gotowych umiejętności do budowania zastosowań agentowych.
Co Gemma 4 12B oznacza dla polskiego biznesu
Najważniejszy jest fakt, że Gemma 4 12B realnie działa na sprzęcie, który firmy już mają. Model mieszczący się w 16 GB pamięci uruchomimy na firmowym laptopie bez wysyłania danych do chmury. Dla działów pracujących na dokumentach objętych RODO to konkretna różnica: dane nie opuszczają urządzenia, a nad przetwarzaniem zachowujemy pełną kontrolę.
Otwarta licencja Apache 2.0 zdejmuje też barierę kosztową. Zamiast rozliczać się za tokeny u zewnętrznego dostawcy, mniejsza firma może osadzić model we własnym procesie, od wstępnej obsługi zapytań po analizę nagrań. To kierunek, w którym lokalne, otwarte modele stają się praktyczną alternatywą dla płatnych API, zwłaszcza tam, gdzie liczy się prywatność i przewidywalny koszt.
Źródło: Google — Introducing Gemma 4 12B (EN)



