Badacze z firmy ServiceNow opublikowali MosaicLeaks, benchmark pokazujący, że agenci AI typu deep research mogą nieświadomie powodować wyciek danych przez agentów AI. Problem nie polega na jednym nieostrożnym zapytaniu. Pojedyncze, pozornie niewinne wyszukiwania w sieci układają się w całość, z której zewnętrzny obserwator potrafi odtworzyć poufne fakty firmowe.
Mechanizm autorzy nazywają „efektem mozaiki". Agent łączy wewnętrzne dokumenty z wyszukiwaniem w internecie i przy okazji każdego zapytania zostawia fragment kontekstu. Jedno zapytanie wspomina o migracji do chmury, drugie o dacie incydentu bezpieczeństwa, trzecie zawęża dostawcę. Każde z osobna wygląda zwyczajnie, lecz razem zdradzają informację, która istniała wyłącznie w prywatnych plikach.
Co dokładnie zmierzono
MosaicLeaks opiera się na 1001 wieloetapowych łańcuchach badawczych, które przeplatają pytania lokalne z zapytaniami do sieci. Benchmark mierzy trzy rodzaje wycieku: ujawnienie intencji badania, ujawnienie odpowiedzi oraz odtworzenie konkretnych prywatnych faktów. Bazowy model (Qwen3-4B) realizował zadania w 48,7 procent przypadków, ale w 34 procentach dochodziło do wycieku danych.
Najważniejszy wniosek dotyczy metod obrony. Samo dodanie instrukcji o prywatności w prompcie obniżyło wyciek tylko z 34 do 25,5 procent. Trenowanie agenta wyłącznie pod skuteczność podniosło wyciek do 51,7 procent, ponieważ model nauczył się upychać w zapytaniach więcej ujawniającego kontekstu. Dopiero metoda PA-DR, łącząca nagrodę za zadanie z osobnym klasyfikatorem prywatności, ścięła wyciek do 9,9 procent przy skuteczności na poziomie 58,7 procent.
Autorzy podsumowują to jednym zdaniem.
Prywatności nie da się wpisać w prompt. Trzeba ją wytrenować.
Co istotne, skuteczniejszy agent wcale nie wyszukiwał mniej. Wysyłał nawet więcej zapytań, ale usuwał z nich zdradzające szczegóły, takie jak konkretne liczby czy daty.
Dla polskich firm wdrażających agentów AI łączących dane wewnętrzne z wyszukiwaniem w sieci to konkretne ostrzeżenie. Asystent badawczy podpięty pod dokumenty działu prawnego, finansowego czy HR może wyprowadzać poufne informacje samym wzorcem swoich zapytań, nawet jeśli nigdy nie wkleja ich wprost. Polityka bezpieczeństwa oparta wyłącznie na instrukcji w systemowym prompcie daje złudne poczucie kontroli. Warto pytać dostawców narzędzi, jak ograniczają ten typ ryzyka, oraz monitorować ruch wychodzący agentów, zamiast zakładać, że skoro nie widać jawnego wycieku, to on nie istnieje.
Źródło: Hugging Face — ServiceNow Research, MosaicLeaks (EN), 18 czerwca 2026.



