Sprawni Cyfrowo
Sprawni Cyfrowo

EVA-Bench 2.0: ServiceNow testuje agentów głosowych AI na 213 scenariuszach

EVA-Bench 2.0: ServiceNow testuje agentów głosowych AI na 213 scenariuszach

Agenci głosowi AI coraz częściej odbierają telefony w obsłudze klienta, działach IT i HR. Jak jednak sprawdzić, czy taki bot poradzi sobie z trudnym rozmówcą, zanim trafi na infolinię? 4 czerwca 2026 roku ServiceNow udostępnił EVA-Bench 2.0: otwarty benchmark do oceny agentów głosowych w realistycznych scenariuszach firmowych.

EVA-Bench 2.0 to około czterokrotnie większy zestaw testów niż pierwsza wersja. Obejmuje 213 scenariuszy i 121 narzędzi API rozłożonych na trzy branże: obsługę klienta linii lotniczych (50 scenariuszy), wsparcie IT w przedsiębiorstwie (80) oraz kadrową obsługę w ochronie zdrowia (83). Każdy scenariusz zweryfikowano na trzech czołowych modelach — GPT-5.4 od OpenAI, Gemini 3.1 Pro od Google i Claude Opus 4.6 od Anthropic. Twórcy zadbali, by każde zadanie rozwiązywał co najmniej jeden z nich, dzięki czemu test jest wymagający, ale uczciwy.

Dlaczego to ważne dla agentów głosowych AI

Najwięcej mówią scenariusze trudne. Benchmark sprawdza rozmowy z wieloma intencjami naraz (do czterech w jednym połączeniu) oraz sytuacje celowo utrudnione: rozmówców pomijających kroki procedury, błędnie oceniających pilność sprawy czy próbujących uzyskać nieautoryzowany dostęp. Każda branża ma też własne procesy uwierzytelniania, łącznie z jednorazowymi kodami OTP tam, gdzie wymaga tego procedura. To odwzorowuje realne ryzyka, których prosty test „czy bot rozumie pytanie” nie wychwyci.

Zestaw jest dostępny na licencji MIT przez Hugging Face, a wyniki modeli można porównać na publicznej tablicy wyników. ServiceNow zapowiada również wersję wielojęzyczną z lokalizacją nazwisk, numerów telefonów i metryk oceny.

Dla polskich firm płynie z tego praktyczny wniosek: zanim agent głosowy AI trafi na infolinię, warto przetestować go na scenariuszach zbliżonych do produkcji, a nie na uproszczonych przykładach. EVA-Bench pokazuje, jak taki test zbudować: z naciskiem na sytuacje brzegowe, uwierzytelnianie i próby obejścia procedur. Zapowiadana wielojęzyczność oznacza, że podobne metryki będzie można wkrótce stosować także do wdrożeń prowadzonych po polsku.

Źródło: ServiceNow — EVA-Bench Data 2.0 (Hugging Face, EN), 4 czerwca 2026. Dokumentacja: arXiv 2605.13841.

Pomożemy Ci wdrożyć sztuczną inteligencję w Twojej firmie.

Konsultacje i wdrożenia AI

Powiązane artykuły