ServiceNow opisał AutoSynthData, system, który generuje dane syntetyczne do trenowania agentów AI pracujących w firmowych systemach. Zamiast ręcznie przygotowywać tysiące przykładów, zespół CoreAI pozwala sprawdzić, gdzie agent się myli, a potem automatycznie tworzy zadania ćwiczące właśnie te umiejętności. Opis ukazał się 2 października na blogu Hugging Face.
Jak działa AutoSynthData
Punktem wyjścia jest porównanie dwóch modeli: trenowanego (docelowego) i silniejszego „nauczyciela”. System sprawdza, na których zadaniach model docelowy zawodzi, i opisuje brakujące umiejętności. Następnie generuje nowe zadania z innymi danymi, stanami systemu i przebiegami pracy. Autorzy tłumaczą to prosto: pojedynczy błąd coś mówi, ale do treningu potrzeba wielu zadań ćwiczących tę samą umiejętność w różnych sytuacjach.
Każde wygenerowane zadanie przechodzi dwie kontrole. Na poziomie próbki system sprawdza, czy zamierzone rozwiązanie działa i czy błędne wyniki są odrzucane, a w razie potrzeby naprawia zadanie. Na poziomie całej partii ocenia pokrycie i różnorodność, wyłapując nadreprezentowane typy zadań. Gdy model się poprawia, generator przesuwa się na pozostałe słabości.
Wyniki na otwartych modelach
Testy przeprowadzono na otwartym modelu Gemma-4-26B-A4B-it. W środowisku EnterpriseOps-Gym, z Qwen3.8-27B jako nauczycielem, system w około 18 godzin wygenerował 2000 próbek treningowych. Skuteczność Pass@1 wzrosła o 7,2 punktu procentowego, czyli około 35% względnie. Według autorów model zamknął 59% pierwotnej luki wydajności.
W domenie ITSM, czyli obsługi zgłoszeń IT, nauczycielem był DeepSeek-V4.1-Flash. Po 1994 próbkach generowanych przez 66 godzin wynik wzrósł z 18,77% do 27,18%.
EnterpriseOps-Gym to publiczny zbiór ServiceNow na licencji Apache 2.0, wydany w marcu 2026 roku. Zawiera około 1150 zadań przygotowanych przez ekspertów w ośmiu obszarach, m.in. kalendarz, e-mail, HR i ITSM, oraz 512 narzędzi udostępnianych przez serwery MCP. Według karty zbioru najlepszy model osiąga w nim 34,1% skuteczności. To dobrze pokazuje, jak trudne dla AI są wieloetapowe procesy firmowe.
Co to znaczy dla polskich firm
Dla firm wdrażających agentów AI to sygnał, że średniej wielkości otwarty model można dostroić do własnych procesów bez miesięcy ręcznego opisywania przykładów. Model z otwartymi wagami da się uruchomić we własnej infrastrukturze, co ułatwia kontrolę nad danymi i zgodność z RODO.
Warto jednak zachować proporcje. Nawet po treningu skuteczność w ITSM to około 27%, więc agent nadal wymaga nadzoru człowieka. Dane syntetyczne nie zastąpią też rzetelnej oceny: zanim agent trafi do pracy, trzeba go sprawdzić na zadaniach z własnej organizacji, a nie tylko na benchmarku. Autorzy nie podali w opisie linku do kodu AutoSynthData, więc na razie to raczej wskazówka metodyczna niż gotowe narzędzie.
Źródło: ServiceNow CoreAI, AutoSynthData (Hugging Face, EN), 2 października 2026. Zbiór danych: EnterpriseOps-Gym (Hugging Face, EN). Oba źródła pochodzą od ServiceNow.



