Izolacja agentów AI to dziś jeden z głównych problemów wdrożeń w firmach, a Anthropic właśnie pokazał, jak rozwiązuje go u siebie. W opublikowanej 30 maja dokumentacji inżynierskiej firma opisała, jak odgradza model Claude od wrażliwych danych w trzech produktach: Claude.ai, Claude Code i Cowork. Główna teza jest prosta: im zdolniejszy agent, tym większy potencjalny zasięg szkód, więc bariery trzeba stawiać na poziomie środowiska, a nie tylko samego modelu.
Każdy produkt dostał inną warstwę izolacji. Claude.ai uruchamia kod w efemerycznych kontenerach gVisor po stronie serwera. Claude Code działa lokalnie z dostępem do plików, więc Anthropic dołożył sandbox systemowy: Seatbelt na macOS i bubblewrap na Linuksie. Cowork idzie najdalej i odpala pełną maszynę wirtualną (Apple Virtualization na macOS, HCS na Windowsie). We wszystkich przypadkach ruch wychodzący ogranicza allowlista zatwierdzonych domen.
Anthropic nie ukrywa własnych wpadek. Przy Claude Code aż 93% próśb o zgodę użytkownicy akceptowali automatycznie. To klasyczne zmęczenie klikaniem. Po wdrożeniu sandboxa liczba pytań spadła o 84%. Firma opisuje też lukę, w której dozwolona domena api.anthropic.com pozwalała wysyłać pliki na konto atakującego; naprawiono ją proxy przepuszczającym tylko token sesji danej maszyny. W teście z wyłudzonym promptem Claude wykonał eksfiltrację danych w 24 na 25 prób — obrony na poziomie modelu zawiodły, bo to sam użytkownik podał złośliwą instrukcję.
Wniosek Anthropic jest jednoznaczny: jeśli dane uwierzytelniające nigdy nie trafią do sandboxa, nie da się ich wykraść. Klucze i pliki w stylu katalogu ~/.aws zostają poza zasięgiem agenta, a kontrola ruchu wychodzącego blokuje wysyłkę niezależnie od intencji. Firma udostępniła swój Sandbox Runtime jako narzędzie open source.
Dla polskich firm wdrażających agentów AI to konkretna lekcja. Po niedawnym wycieku przez Microsoft Copilot Cowork widać, że ryzyko nie jest teoretyczne. Bezpieczeństwo agenta nie polega na zaufaniu, że model „nie zrobi nic złego”. Liczą się twarde granice: izolacja procesów, maszyny wirtualne, separacja sekretów i kontrola ruchu sieciowego. Zanim agent dostanie dostęp do firmowych plików czy API, warto zapytać, co się stanie, gdy ktoś podsunie mu spreparowaną instrukcję.
Źródło: Anthropic — How we contain Claude (EN), 30 maja 2026. Komentarz: Simon Willison (EN).



