Nvidia pokazała, że o skuteczności decyduje przede wszystkim harness agenta AI, czyli oprogramowanie otaczające model językowy, a nie sam model. W benchmarku ARC-AGI-3 ten sam Claude Opus 5 z dopracowanym harnessem osiągnął 100 proc. skuteczności, a bez niego zaledwie 30 proc. Różnicę zrobiła warstwa narzędzi, pamięci i reguł wokół modelu.
Co dokładnie pokazała Nvidia
Harness to całe rusztowanie wokół modelu: dostęp do narzędzi, zarządzanie pamięcią, obsługa kontekstu, reguły działania i pętle informacji zwrotnej. Dopiero one zamieniają surowy model w autonomicznego agenta. ARC-AGI-3 to test złożony z interaktywnych gier 2D, w których agent musi radzić sobie bez instrukcji, więc dobrze mierzy zdolność planowania krok po kroku.
Badacze Nvidii dodali komponent „nadzorcy", który działa trochę jak szef i zawraca agenta z nieproduktywnych ścieżek. Adel El Hallak, wiceprezes Nvidii, podkreślił, że agentem nie jest sam model, lecz właśnie rusztowanie wokół niego. Podobny wniosek płynie z prac OpenAI: zmiana dwóch ustawień harnessu potroiła wyniki w ARC-AGI-3, choć żaden układ nie sięgnął 100 proc. Autorzy zwracają też uwagę, że dobór rusztowania potrafi podwoić koszty operacyjne agenta.
Co to znaczy dla polskiego biznesu
Dla firm wdrażających AI to konkretna wskazówka: wybierając narzędzie agentowe, nie patrz wyłącznie na nazwę modelu. O jakości i koszcie decyduje warstwa wokół niego: integracje, kontrola kontekstu, uprawnienia i nadzór. Ten sam model w słabym harnessie da słabe wyniki, a dobrze zaprojektowany działa sprawniej i taniej. Warto też sprawdzić, gdzie agent przetwarza dane i jakie ma uprawnienia, bo to element zgodności z RODO.
Zanim więc zdecydujesz się na „najnowszy model", oceń cały system agenta i to, jak radzi sobie z zadaniami wieloetapowymi. Warto utrzymać człowieka w pętli oraz zasadę najmniejszych uprawnień, bo autonomiczny agent działa dokładnie tak dobrze, jak jego rusztowanie.
Źródło: TechCrunch (EN), 21 sierpnia 2026. Pojedyncze źródło dla tej relacji.



