Sprawni Cyfrowo
Sprawni Cyfrowo

IBM Granite Embedding R2: dwa otwarte modele AI z polskim w 52 językach

IBM Granite Embedding R2: dwa otwarte modele AI z polskim w 52 językach

IBM udostępnił 14 maja dwa nowe modele Granite Embedding Multilingual R2 w wersjach 97M i 311M parametrów. Oba są otwarte na licencji Apache 2.0, obsługują 200+ języków z polskim w zestawie 52 wzmocnionych, mają kontekst 32 768 tokenów i deklarują najlepsze w klasie wyniki na benchmarku MTEB Multilingual Retrieval. Mniejszy model 97M osiąga 60,3 punktu, najwięcej wśród modeli poniżej 100M parametrów, a 311M plasuje się z wynikiem 65,2 na drugim miejscu wśród otwartych modeli poniżej 500M.

Embeddingi to wektory liczbowe reprezentujące znaczenie tekstu. Stanowią fundament wyszukiwania semantycznego, systemów RAG i podobnych zastosowań AI. Wersja R2 jest skokiem względem R1: kontekst urósł 64-krotnie (z 512 do 32 768 tokenów), a wyniki MTEB poprawiły się o ponad 12 punktów. Architektura przeszła z XLM-RoBERTa na ModernBERT z rotary position embeddings i Flash Attention 2.0. Model 311M wspiera też Matryoshka Representation Learning, co pozwala obciąć wektor do 128, 256, 384 lub pełnych 768 wymiarów bez znaczącej utraty jakości. Przy 6-krotnej redukcji storage model nadal zachowuje ponad 97% wydajności wyszukiwania.

Co to znaczy dla polskich firm

Granite Embedding R2 to praktyczny krok naprzód dla każdej organizacji budującej wyszukiwarki semantyczne czy chatboty oparte na własnych dokumentach po polsku. Do tej pory typowe biblioteki LangChain czy LlamaIndex domyślnie używały modeli takich jak paraphrase-multilingual-MiniLM-L12-v2, wobec którego Granite 97M ma aż 23,7 punktu przewagi na MTEB. Przekłada się to wprost na trafność odpowiedzi w polskojęzycznym RAG: mniej halucynacji i lepsze dopasowanie do pytań użytkowników.

Apache 2.0 oznacza brak ryzyk licencyjnych przy zastosowaniach komercyjnych. Model można uruchomić lokalnie na własnym GPU lub w wariancie ONNX i OpenVINO na CPU, bez przesyłania danych do zewnętrznych API. Dla branż regulowanych (finanse, ochrona zdrowia, sektor publiczny) to istotny argument zgodności i bezpieczeństwa danych. Przepustowość 311M wynosi około 1 800 dokumentów na sekundę, czyli 5,5 raza szybciej niż jina-embeddings-v5-text-nano przy wyższej jakości wyszukiwania. Mniejszy 97M to z kolei dobry kandydat na deployment edge: waży 195 MB w safetensors i 98 MB po kwantyzacji ONNX.

IBM celowo wykluczył z danych treningowych zbiór MS-MARCO oraz materiały z licencjami niekomercyjnymi, redukując ryzyko prawne przy wdrożeniach produkcyjnych. To rzadkość w świecie modeli embeddingowych. Większość konkurencji w tej kategorii ma w tle co najmniej kilka spornych źródeł.

Źródło: Hugging Face Blog — Granite Embedding Multilingual R2 (EN), publikacja 14 maja 2026.

Pomożemy Ci wdrożyć sztuczną inteligencję w Twojej firmie.

Konsultacje i wdrożenia AI

Powiązane artykuły