Sprawni Cyfrowo
Sprawni Cyfrowo

ITBench-AA: pierwszy benchmark agentów AI w IT. Najlepsze modele poniżej 50%

ITBench-AA: pierwszy benchmark agentów AI w IT. Najlepsze modele poniżej 50%

Nowy benchmark agentów AI w zadaniach IT pokazuje, że frontier modele nie są jeszcze gotowe do autonomicznego zarządzania infrastrukturą. ITBench-AA, opublikowany 27 maja 2026 przez IBM Software Innovation Lab i Artificial Analysis, sprawdził największe modele na realnych zadaniach Site Reliability Engineering. Wszystkie uzyskały wynik poniżej 50 procent.

Benchmark testuje agentów na 59 zadaniach diagnozy incydentów w klastrach Kubernetes. Model dostaje logi, metryki i alerty, a następnie musi wskazać minimalny zestaw obiektów (Deployments, Services, Pods, NetworkPolicies) odpowiedzialnych za awarię. Wynik liczony jest jako precyzja przy pełnym recall: pominięcie choćby jednej prawdziwej przyczyny daje zero punktów. Najlepiej poradził sobie Claude Opus 4.7 z wynikiem 47 procent przy koszcie 5,38 USD za zadanie, tuż za nim GPT-5.5 z 46 procentami. Co ciekawe, więcej tur agenta nie przekłada się na lepszą jakość: Gemini 3.1 Pro Preview, mimo średnio 83 tur na zadanie, osiągnął tylko 30 procent, a otwarty Gemma 4 31B przebił go wynikiem 37 procent za 14 centów. Otwarte modele z wbudowanym mechanizmem rozumowania (GLM-5.1 z 40 procentami, DeepSeek V4 Pro z 38) konsekwentnie biją swoje zamknięte odpowiedniki o podobnej skali.

Co to znaczy dla polskiego biznesu

Dla firm planujących wdrożenie agentów AI w działach IT (DevOps, SRE, NOC) wnioski są trzeźwe. Autonomiczna diagnostyka incydentów Kubernetes pozostaje poza zasięgiem najmocniejszych modeli, więc projekty „AI sam zarządza infrastrukturą” pozostają w 2026 roku w trybie copilot, nie pilot. ITBench-AA jest też dobrym argumentem za modelami specjalistycznymi i otwartymi: GLM-5.1 i Gemma 4 dorównują dużym modelom zamkniętym za ułamek ceny. Po stronie zarządczej praktyczna porada: zanim podpiszesz kontrakt na enterprise AI dla operacji IT, poproś dostawcę o wyniki na ITBench-AA albo równoważnym publicznym benchmarku. Dla zespołów szkoleniowych to sygnał: lepsze efekty da dziś szkolenie ludzi z analizy danych obserwacyjnych i współpracy z agentami AI niż czekanie na pełną autonomię modeli.

Źródło: Hugging Face Blog — IBM Research, „ITBench-AA: Frontier Models Score Below 50%” (27 maja 2026, EN).

Pomożemy Ci wdrożyć sztuczną inteligencję w Twojej firmie.

Konsultacje i wdrożenia AI

Powiązane artykuły