Anthropic wydał Claude Opus 4.8, najnowszą wersję swojego najmocniejszego publicznie dostępnego modelu. Premiera odbyła się w czwartek, 41 dni po Opus 4.7. Firma opisuje zmianę skromnie: „modest but tangible improvement". Najważniejsza nowość nie dotyczy jednak surowej mocy, lecz uczciwości modelu i pracy z wieloma agentami naraz.
Według testów Anthropic Opus 4.8 częściej sygnalizuje wątpliwości co do własnej pracy i rzadziej formułuje twierdzenia bez pokrycia. Model osiągnął najniższy odsetek błędnych odpowiedzi spośród sześciu testowanych modeli, głównie dlatego, że przy niepewnych pytaniach wstrzymuje się od odpowiedzi, zamiast zgadywać. W zadaniach programistycznych jest czterokrotnie rzadziej skłonny przepuścić błąd w kodzie niż poprzednia wersja.
Co dokładnie zmienia Claude Opus 4.8
Cennik pozostaje bez zmian względem wersji 4.5–4.7: 5 dolarów za milion tokenów wejściowych i 25 dolarów za milion wyjściowych. Okno kontekstu to nadal milion tokenów, maksymalny wynik to 128 tysięcy tokenów, a granica wiedzy sięga stycznia 2026. Tańszy jest za to tryb fast: teraz kosztuje dwukrotność stawki standardowej zamiast wcześniejszych 30 i 150 dolarów.
Doszły też udogodnienia techniczne. Model obsługuje systemowe komunikaty w trakcie rozmowy, więc można zmienić instrukcje bez powtarzania całego promptu. Minimalny próg cache promptów spadł z 4096 do 1024 tokenów. Równolegle Anthropic udostępnił w wersji testowej narzędzie Dynamic Workflows, które pozwala koordynować setki subagentów pracujących jednocześnie. W połączeniu z Claude Code ma to umożliwiać migracje całych baz kodu: setki tysięcy linii od startu do scalenia, z istniejącym zestawem testów jako poprzeczką.
Wiarygodność tego kierunku potwierdza Bridgewater Associates, który zwrócił uwagę, że Opus 4.8 sam z siebie zgłasza problemy z danymi wejściowymi i wynikami analizy — coś, co inne modele rutynowo pomijały.
Dla polskich firm istotniejsza od benchmarków jest właśnie ta zmiana w zachowaniu. Model, który przyznaje „nie wiem", zamiast pewnie podawać błędną liczbę, obniża ryzyko przy wdrożeniach w księgowości, analizie danych czy obsłudze klienta. Tańszy tryb fast i niższy próg cache realnie zmniejszają koszty częstych, krótkich zapytań, typowych dla automatyzacji procesów w mniejszych zespołach.
Źródło: TechCrunch (EN) oraz Simon Willison (EN), 28 maja 2026.



