Sprawni Cyfrowo
Sprawni Cyfrowo

Tydzień w AI: agenci AI pod kontrolą (29 września – 5 października 2026)

Tydzień w AI: agenci AI pod kontrolą (29 września – 5 października 2026)

Tydzień od 29 września do 5 października 2026 r. w AI miał jeden wyraźny motyw: agenci AI dostają coraz więcej uprawnień, a branża w pośpiechu dorabia do nich zamki, liczniki i kontrolę jakości. Microsoft pokazał, że agent potrafi raportować sukces, zostawiając w bazie błędne dane. Apple zapowiedział zaostrzenie pełnego dostępu do dysku w macOS. Chmury publiczne wprowadzają twarde limity wydatków, bo agent kodujący potrafi uruchomić płatną usługę w kilka minut.

Nowe modele też się pojawiły, i to szybko. Ciekawsze jest jednak to, co działo się wokół nich: decyzje o tym, komu, kiedy i na jakich warunkach oddać kontrolę. Poniżej trzy najważniejsze wydarzenia tygodnia, wspólny mianownik i wnioski dla polskich firm.

Agenci AI w tym tygodniu: trzy najważniejsze wydarzenia

1. ThinkingBox: agent mówi „gotowe”, baza danych mówi co innego

Najbardziej praktyczną lekturą tygodnia był ThinkingBox, otwarte środowisko testowe od Microsoftu i Hugging Face. Zamiast oceniać, co agent sam raportuje, sprawdza faktyczny stan bazy danych po zadaniu. Każde z 507 zadań uruchamiano 20 razy od czystego stanu. Wynik jest otrzeźwiający. Kimi-K3 rozwiązał przynajmniej raz niemal 94% zadań, ale komplet 20 na 20 zaliczył tylko w nieco ponad 13% przypadków. Do tego około dwie trzecie nieudanych prób zakończyło się bez żadnego zgłoszonego błędu narzędzia.

To zmienia sposób myślenia o pilotażach. Jedno udane demo niczego nie dowodzi, a „cichy błąd” bywa droższy niż jawna awaria. Autorzy policzyli też koszt zadania wykonanego niezawodnie i okazało się, że tańszy model nie zawsze oznacza tańsze wdrożenie. Szczegóły opisaliśmy w tekście Microsoft ThinkingBox: agent AI mówi „gotowe”, baza danych twierdzi inaczej.

2. Apple zaostrza Full Disk Access z powodu agentów AI

2 października Apple zapowiedział dodatkowe zabezpieczenia uprawnienia Full Disk Access w macOS. Powód podał wprost: coraz bardziej autonomiczni agenci AI. Pełny dostęp do dysku powstał z myślą o aplikacjach do kopii zapasowych, a w praktyce otwiera pliki, pocztę, wiadomości i historię przeglądania. Nowe kontrolki mają wymagać bardzo wyraźnego działania użytkownika. Daty i wersji systemu Apple nie podał.

Tło jest istotne. Kilka dni wcześniej trwał spór o to, czy agent Meta Muse odczytywał prywatne wiadomości felietonisty Inc. Meta zarzutom zaprzecza, ale dyskusja pokazała, jak łatwo szeroki dostęp nadany jednym kliknięciem wymyka się kontroli działu IT. Więcej w artykułach Apple zaostrzy Full Disk Access w macOS oraz Meta Muse pod lupą.

3. Twarde limity wydatków w chmurze

Simon Willison zaapelował 3 października o domyślne, twarde limity wydatków u dostawców chmury. Jego argument: agenci kodujący pozwalają postawić płatną usługę w minuty, a rachunek rośnie szybciej, niż ktoś zdąży zareagować. Rynek już idzie w tę stronę. Google Cloud wprowadził Spend Caps w lipcu, a AWS we wrześniu uruchomił limity na poziomie projektu. Po ich przekroczeniu projekt jest wstrzymywany, a dane są przechowywane przez 90 dni. Jeśli właściciel nie zareaguje, zostaną usunięte.

AWS dodał też „wczesne hamulce”, które kilka dni przed limitem blokują nowe zasoby i usypiają bezczynne instancje. Sam Amazon pozycjonuje tę funkcję głównie dla środowisk testowych i eksperymentów. Pełne omówienie znajdziesz w tekście Agenci AI a rachunki za chmurę.

Co łączy te newsy: kontrola nad agentami AI staje się produktem

Te trzy historie nie są przypadkowym zbiegiem. Przez ostatnie miesiące rynek ścigał się na możliwości: kto szybciej wykona zadanie, kto obsłuży komputer, kto napisze więcej kodu. W tym tygodniu ciężar przesunął się na pytanie, jak agentom ufać. Odpowiedzią są trzy warstwy: weryfikacja skutku (ThinkingBox), ograniczenie dostępu (Apple) i ograniczenie kosztu (limity w chmurze).

Dlaczego właśnie teraz? Bo agenci przestali być demonstracją. Działają na komputerach pracowników, w systemach zgłoszeń, w chmurze i w sklepach internetowych. Gdy agent ma dostęp do prawdziwych danych i prawdziwych pieniędzy, każdy błąd przestaje być ciekawostką i staje się incydentem. Dostawcy to rozumieją i budują zabezpieczenia, zanim zrobią to za nich regulatorzy albo klienci.

Ten sam wzór widać w pozostałych newsach tygodnia. Startup Reco pozyskał 55 mln USD na platformę, która pokazuje, do czego agent ma dostęp. U jednego klienta z listy Fortune 100 wykryła około 21 tys. agentów, o których nikt nie wiedział. Polskie Xopero przejęło Vigil Guard, czyli warstwę wykrywającą prompt injection i maskującą dane takie jak PESEL czy NIP, zanim trafią do modelu. Bezpieczeństwo agentów przestaje być funkcją dodatkową i staje się osobną kategorią rynku.

Dostawcy modeli też zaczęli dawkować moc. Google udostępnił Gemini 4 Argon najpierw zaufanym obrońcom cyberbezpieczeństwa. Do płatnego API model ma trafić później. OpenAI wypuściło tańszy GPT-6.1 Sol, ale większą Astrę 6.1 wstrzymało po słabych wynikach testów zgodności z intencjami człowieka. Z kolei Google zamroził część programu bug bounty dla open source, bo nie nadążał z weryfikacją masowych, często błędnych zgłoszeń z AI. To druga strona tej samej monety: automatyzacja bez filtra jakości zalewa ludzi pracą.

Jednocześnie agenci zyskują nowe możliwości działania w świecie. Shopify otworzył kasę dla agentów w przeglądarce, ale przy 3D Secure oddaje kontrolę kupującemu. Kierunek jest więc jasny. Agent dostaje więcej, lecz w kluczowych momentach decyzja wraca do człowieka.

Co to znaczy dla polskich firm wdrażających agentów AI

Dla 30-osobowej firmy, która dopiero testuje asystentów i agentów, ten tydzień daje gotową listę kontrolną. Nie trzeba czekać na nowe wersje systemów ani regulacje. Wystarczy przyjąć kilka zasad, które duzi gracze właśnie wpisują w swoje produkty.

  • Mierz skutek, nie raport. Pilotaż agenta oceniaj w CRM, ERP czy systemie zgłoszeń, a nie po jego podsumowaniu. Uruchamiaj te same przypadki wielokrotnie i licz, ile razy agent wykonał je poprawnie.
  • Zrób spis uprawnień. Sprawdź, które aplikacje na służbowych komputerach mają pełny dostęp do dysku, poczty i komunikatorów. Agentowi daj dostęp do wybranych folderów lub integracji, a nie do wszystkiego.
  • Ustaw limity kosztów. Oddziel projekty eksperymentalne od produkcyjnych. Na eksperymentach ustaw twardy limit i przypisz każdemu projektowi właściciela odpowiedzialnego za budżet.
  • Pamiętaj o RODO. Agent czytający pocztę przetwarza dane osobowe także osób trzecich. Potrzebna jest podstawa prawna, umowa powierzenia i polityka przechowywania danych.

Jest też wątek kadrowy. Z raportu płacowego Antal, o którym pisaliśmy przy okazji zarobków w IT w 2026 roku, wynika, że zyskują specjaliści od AI i cyberbezpieczeństwa. To dokładnie te kompetencje, których wymaga bezpieczne wdrażanie agentów. Firmy, które nie zatrudnią takich osób, muszą je wykształcić we własnym zespole.

Dobrym pierwszym krokiem jest jeden, wąsko zdefiniowany proces. Na przykład kategoryzacja zgłoszeń w dziale obsługi klienta albo przygotowanie szkiców odpowiedzi na typowe pytania. Agent działa tam na ograniczonym zbiorze danych, a efekt łatwo zweryfikować. Dopiero gdy wyniki są powtarzalne, warto rozszerzać zakres i uprawnienia.

Wreszcie koszty. Tańsze modele, takie jak GPT-6.1 Sol czy Claude Sonnet 5.5, obniżają barierę wejścia. ThinkingBox przypomina jednak, że liczy się koszt zadania wykonanego niezawodnie, a nie cena za token. Porównując dostawców, warto testować ich na własnych procesach i własnych danych.

Jak Sprawni Cyfrowo pomaga bezpiecznie wdrażać agentów AI

Agent AI może realnie odciążyć zespół, ale tylko wtedy, gdy wiadomo, co robi, do czego ma dostęp i ile kosztuje. Pomagamy firmom przejść tę drogę bez kosztownych niespodzianek:

  • Wdrożenia AI w firmach: projektujemy pilotaże agentów z mierzalnymi kryteriami sukcesu, kontrolą uprawnień i człowiekiem w pętli tam, gdzie decyzja wpływa na klienta.
  • Szkolenia z kompetencji cyfrowych i AI: uczymy zespoły bezpiecznej pracy z asystentami i agentami, w tym zasad ochrony danych i rozpoznawania ryzyk, takich jak prompt injection.
  • Konsultacje technologiczne: pomagamy wybrać model i dostawcę, porównując koszt rzeczywistych zadań, a nie same cenniki.

Planujesz pierwszego agenta w swojej firmie albo chcesz uporządkować te, które już działają? Skontaktuj się z nami, a wspólnie przygotujemy plan wdrożenia dopasowany do Twoich procesów.

Pomożemy Ci wdrożyć sztuczną inteligencję w Twojej firmie.

Konsultacje i wdrożenia AI

Powiązane artykuły