Google DeepMind udostępnił Gemini Robotics ER 2, model „rozumowania ucieleśnionego", który pełni rolę wysokopoziomowego mózgu dla robotów. Nowość ogłoszono 30 lipca 2026 roku jako część rodziny Gemini Robotics 2. ER 2 nie steruje bezpośrednio silnikami. Planuje wieloetapowe zadania, analizuje obraz z kamer i koordynuje modele wykonawcze oraz zewnętrzne narzędzia.
To wyraźny krok naprzód względem poprzednika, modelu ER 1.6. Kluczowa zmiana to ciągła analiza strumienia wideo zamiast pojedynczych zdjęć. Model śledzi postęp zadania w pięciu poziomach zaawansowania z dokładnością 57,4 procent, a moment kluczowego zdarzenia w nagraniu wskazuje z trafnością 91,3 procent i średnim błędem 0,96 sekundy. Wyszukiwanie takich momentów działa według DeepMind cztery razy szybciej niż wcześniej, przy ułamku dawnych kosztów obliczeniowych.
Co potrafi Gemini Robotics ER 2
Model łączy się z Gemini Live API przez dwukierunkowy strumień, co pozwala reagować w czasie zbliżonym do rzeczywistego. Dzięki temu robot wykrywa własne błędy i koryguje działania w trakcie pracy. DeepMind pokazał orkiestrację robota Spot od Boston Dynamics przy podawaniu przedmiotów oraz współpracę dwóch różnych maszyn: humanoida Apptronik Apollo 2 oraz ramienia Franka F3 Duo, które przekazują sobie zadania dzięki wspólnemu rozumieniu semantycznemu.
Rozszerzono też odczyt przyrządów, w tym wyświetlaczy cyfrowych, skal, linijek i termometrów. Wbudowano również mechanizmy bezpieczeństwa. Model zatrzymuje humanoida, gdy w pobliżu wykryje człowieka. ER 2 jest dostępny przez Gemini API i Google AI Studio, a na platformie Gemini Enterprise Agent działa w prywatnej wersji zapoznawczej. Rodzina obejmuje także model wykonawczy VLA oraz wariant On-Device 2, który adaptuje się do nowego typu robota w kilka godzin, zwykle na mniej niż 200 przykładach.
Dla polskich firm z logistyki, magazynowania i produkcji istotny jest nie sam humanoid, lecz warstwa sterująca. Model, który rozumie wideo i rozdziela zadania między kilka maszyn, obniża próg wdrożenia automatyzacji tam, gdzie dotąd trzeba było programować każdy ruch osobno. To kierunek zbieżny z inwestycjami dużych graczy w zautomatyzowane centra dystrybucji nad Wisłą. Warto śledzić dostępność API, zanim technologia trafi do integratorów.
Źródło: Google DeepMind — Gemini Robotics ER 2 (30 lipca 2026).



