Sprawni Cyfrowo
Sprawni Cyfrowo

Gemini Robotics ER 2: DeepMind daje robotom rozumienie wideo

Gemini Robotics ER 2: DeepMind daje robotom rozumienie wideo

Google DeepMind udostępnił Gemini Robotics ER 2, model „rozumowania ucieleśnionego", który pełni rolę wysokopoziomowego mózgu dla robotów. Nowość ogłoszono 30 lipca 2026 roku jako część rodziny Gemini Robotics 2. ER 2 nie steruje bezpośrednio silnikami. Planuje wieloetapowe zadania, analizuje obraz z kamer i koordynuje modele wykonawcze oraz zewnętrzne narzędzia.

To wyraźny krok naprzód względem poprzednika, modelu ER 1.6. Kluczowa zmiana to ciągła analiza strumienia wideo zamiast pojedynczych zdjęć. Model śledzi postęp zadania w pięciu poziomach zaawansowania z dokładnością 57,4 procent, a moment kluczowego zdarzenia w nagraniu wskazuje z trafnością 91,3 procent i średnim błędem 0,96 sekundy. Wyszukiwanie takich momentów działa według DeepMind cztery razy szybciej niż wcześniej, przy ułamku dawnych kosztów obliczeniowych.

Co potrafi Gemini Robotics ER 2

Model łączy się z Gemini Live API przez dwukierunkowy strumień, co pozwala reagować w czasie zbliżonym do rzeczywistego. Dzięki temu robot wykrywa własne błędy i koryguje działania w trakcie pracy. DeepMind pokazał orkiestrację robota Spot od Boston Dynamics przy podawaniu przedmiotów oraz współpracę dwóch różnych maszyn: humanoida Apptronik Apollo 2 oraz ramienia Franka F3 Duo, które przekazują sobie zadania dzięki wspólnemu rozumieniu semantycznemu.

Rozszerzono też odczyt przyrządów, w tym wyświetlaczy cyfrowych, skal, linijek i termometrów. Wbudowano również mechanizmy bezpieczeństwa. Model zatrzymuje humanoida, gdy w pobliżu wykryje człowieka. ER 2 jest dostępny przez Gemini API i Google AI Studio, a na platformie Gemini Enterprise Agent działa w prywatnej wersji zapoznawczej. Rodzina obejmuje także model wykonawczy VLA oraz wariant On-Device 2, który adaptuje się do nowego typu robota w kilka godzin, zwykle na mniej niż 200 przykładach.

Dla polskich firm z logistyki, magazynowania i produkcji istotny jest nie sam humanoid, lecz warstwa sterująca. Model, który rozumie wideo i rozdziela zadania między kilka maszyn, obniża próg wdrożenia automatyzacji tam, gdzie dotąd trzeba było programować każdy ruch osobno. To kierunek zbieżny z inwestycjami dużych graczy w zautomatyzowane centra dystrybucji nad Wisłą. Warto śledzić dostępność API, zanim technologia trafi do integratorów.

Źródło: Google DeepMind — Gemini Robotics ER 2 (30 lipca 2026).

Pomożemy Ci wdrożyć sztuczną inteligencję w Twojej firmie.

Konsultacje i wdrożenia AI

Powiązane artykuły