Gemini 機器人由 Google DeepMind 在 7 月 30 日發表 Gemini Robotics 2,讓 AI 嘗試處理人類看來普通、但實際充滿變數的工作:聽懂口語指令後,走到指定位置、找出物件、完成放置,並判斷下一步應如何執行。
Gemini 機器人不再只是預設動作
過去不少機器人示範是跳舞、翻筋斗,或在桌面上夾起物件,動作多為特定場景預先設計。現實工作環境卻不是舞台,貨箱未必放在原位,通道可能有人經過,地面也未必平整。
官方示範中,Apptronik 的 Apollo 2 聽到「把水壺放到下層架的綠色箱子」後,會走到桌邊取起水壺,再移到層架完成放置。重點不是它懂得拿水壺,而是要把一句人類語言拆成多個實體步驟,並依現場情況調整執行順序與動作。

重點不只在移動,Gemini 機器人處理工作流程
Google 將系統拆成三個角色分工:Gemini Robotics 2 負責把視覺與語言資訊轉成身體動作;Gemini Robotics ER 2 負責理解環境、規劃多步任務與追蹤進度;On-Device 2 可以在機器人本體運行,減少對網路連線的依賴。
在這個架構下,ER 2 像一個高階協調者,不只是接收「向前走三步」這類單一命令,而是先找物件,再移動,最後放到指定位置,整個過程還要不斷確認任務是否完成。
官方影片
Google DeepMind 的官方示範影片展示 Gemini Robotics 2 如何處理全身動作、精細操作,以及多部機器人協作完成任務的流程。
靈巧操作仍有技術與實務限制
官方展示中,系統能控制五指機械手完成綁繩、封密實袋等細緻動作,也可以配合不同夾具處理多樣物件。不過,Google 承認移動速度與多指精細操作仍有改善空間,未來仍須技術優化與更多現場測試。
相關報導指出,系統目前仍需透過遙距操作、人類示範影片與模擬資料訓練,並不是看過一次便能學會所有新工作。現階段面向一般開發者主要開放的是 ER 2,全身操控與本地運行模型則僅供早期合作夥伴使用。

有手有腳的機器人錯誤風險更高
Chatbot 答錯問題可以重新提問,機器人誤判指令卻可能撞到人、弄跌貨物,或在不適當的場所繼續執行任務。當 AI 有了手腳,安全問題從內容準確度延伸到實際行為的可控性與停機判斷。
Google 同步推出 ASIMOV-Agentic 安全評測,檢查模型能否拒絕危險指令、辨識任務可行性,並在不確定時要求人類介入。真正的實務問題包括誰有權授權機器人執行任務、誰能即時叫停,以及出事後是否能追查決策過程。

