Sprawni Cyfrowo
Sprawni Cyfrowo

Claude Opus 4.8: Anthropic stawia na uczciwość modelu i agentowe workflow

Claude Opus 4.8: Anthropic stawia na uczciwość modelu i agentowe workflow

Anthropic wydał Claude Opus 4.8, najnowszą wersję swojego najmocniejszego publicznie dostępnego modelu. Premiera odbyła się w czwartek, 41 dni po Opus 4.7. Firma opisuje zmianę skromnie: „modest but tangible improvement". Najważniejsza nowość nie dotyczy jednak surowej mocy, lecz uczciwości modelu i pracy z wieloma agentami naraz.

Według testów Anthropic Opus 4.8 częściej sygnalizuje wątpliwości co do własnej pracy i rzadziej formułuje twierdzenia bez pokrycia. Model osiągnął najniższy odsetek błędnych odpowiedzi spośród sześciu testowanych modeli, głównie dlatego, że przy niepewnych pytaniach wstrzymuje się od odpowiedzi, zamiast zgadywać. W zadaniach programistycznych jest czterokrotnie rzadziej skłonny przepuścić błąd w kodzie niż poprzednia wersja.

Co dokładnie zmienia Claude Opus 4.8

Cennik pozostaje bez zmian względem wersji 4.5–4.7: 5 dolarów za milion tokenów wejściowych i 25 dolarów za milion wyjściowych. Okno kontekstu to nadal milion tokenów, maksymalny wynik to 128 tysięcy tokenów, a granica wiedzy sięga stycznia 2026. Tańszy jest za to tryb fast: teraz kosztuje dwukrotność stawki standardowej zamiast wcześniejszych 30 i 150 dolarów.

Doszły też udogodnienia techniczne. Model obsługuje systemowe komunikaty w trakcie rozmowy, więc można zmienić instrukcje bez powtarzania całego promptu. Minimalny próg cache promptów spadł z 4096 do 1024 tokenów. Równolegle Anthropic udostępnił w wersji testowej narzędzie Dynamic Workflows, które pozwala koordynować setki subagentów pracujących jednocześnie. W połączeniu z Claude Code ma to umożliwiać migracje całych baz kodu: setki tysięcy linii od startu do scalenia, z istniejącym zestawem testów jako poprzeczką.

Wiarygodność tego kierunku potwierdza Bridgewater Associates, który zwrócił uwagę, że Opus 4.8 sam z siebie zgłasza problemy z danymi wejściowymi i wynikami analizy — coś, co inne modele rutynowo pomijały.

Dla polskich firm istotniejsza od benchmarków jest właśnie ta zmiana w zachowaniu. Model, który przyznaje „nie wiem", zamiast pewnie podawać błędną liczbę, obniża ryzyko przy wdrożeniach w księgowości, analizie danych czy obsłudze klienta. Tańszy tryb fast i niższy próg cache realnie zmniejszają koszty częstych, krótkich zapytań, typowych dla automatyzacji procesów w mniejszych zespołach.

Źródło: TechCrunch (EN) oraz Simon Willison (EN), 28 maja 2026.

Pomożemy Ci wdrożyć sztuczną inteligencję w Twojej firmie.

Konsultacje i wdrożenia AI

Powiązane artykuły