Thinking Machines Lab, startup założony przez Mirę Murati — byłą CTO OpenAI — zaprezentował nową kategorię AI konwersacyjnego, którą firma nazywa interaction models. Kluczowa różnica: model przetwarza wejście użytkownika i generuje odpowiedź jednocześnie, zamiast działać naprzemiennie — słuchać, czekać, mówić.
Dotychczasowe asystenty głosowe, w tym produkty OpenAI i Google, działają w architekturze half-duplex. TML-Interaction-Small, pierwszy model z nowej rodziny, implementuje pełnodupleksowe przetwarzanie jako wbudowaną cechę architektury. Wynik: czas reakcji 0,40 sekundy — porównywalny z naturalnym tempem odpowiedzi człowieka. Benchmarki firmy plasują TML-Interaction-Small korzystnie na tle rozwiązań OpenAI i Google, choć niezależna weryfikacja będzie możliwa dopiero po szerszym udostępnieniu modelu.
Pełny dupleks a praktyczne AI konwersacyjne
Tradycyjny model głosowy działa jak krótkofalówka: jeden mówi, drugi czeka. Architektura pełnodupleksowa pozwala modelowi jednocześnie analizować wejście użytkownika i konstruować własną odpowiedź — jak w normalnej rozmowie telefonicznej. Eliminuje to charakterystyczne pauzy, które w obecnych systemach sygnalizują potrzebę czekania i sprawiają, że interakcja wydaje się mechaniczna.
TML-Interaction-Small jest na razie dostępny wyłącznie jako ograniczony research preview dla wybranych partnerów. Szeroka publiczna dostępność zaplanowana jest na późniejsze miesiące 2026 roku.
Co to oznacza dla firm wdrażających AI konwersacyjne
Dla polskich organizacji rozważających boty głosowe w obsłudze klienta, automatyzację infolinii lub wewnętrznych asystentów, pełnodupleksowa interakcja może bezpośrednio poprawić doświadczenie użytkownika. Badania nad UX systemów dialogowych wskazują, że opóźnienia powyżej 0,5 sekundy wyraźnie obniżają komfort rozmowy. TML-Interaction-Small mieści się poniżej tego progu.
Thinking Machines Lab nie ujawnił dotychczas szczegółów dotyczących finansowania ani harmonogramu komercjalizacji. Warto jednak obserwować tę technologię — architektura pełnodupleksowa może wkrótce stać się nowym standardem dla systemów głosowych w środowiskach firmowych.
Źródło: TechCrunch, 12 maja 2026 (EN)



