Google DeepMind 7 月 30 日發表 Gemini Robotics 2,讓 AI 嘗試處理人類看來普通、實際充滿變數的工作:聽懂指令後,走到指定位置、找出物件、完成放置,再判斷下一步。當 AI 不只會說,還開始會「做」,最先被改寫的可能不是文職工作,而是大量要在真實空間臨場判斷的任務。
不再只是預設動作
過去不少機械人示範是跳舞、翻筋斗,或在桌面上夾起物件,動作多為特定場景預先設計。現實工作環境卻不是舞台,貨箱未必放在原位,通道可能有人經過,地面也未必平整。
官方示範中,Apptronik 的 Apollo 2 聽到「把水壺放到下層架的綠色箱子」後,會走到桌邊取起水壺,再移到層架完成放置。重點不是它懂得拿水壺,而是要把一句人類語言拆成多個實體步驟,再按照現場情況調整動作。

重點不只在移動
Google 把系統拆成三部分。Gemini Robotics 2 負責把視覺與語言轉成身體動作;Gemini Robotics ER 2 負責理解環境、規劃多步任務和追蹤進度;On-Device 2 則可在機械人本體運行,減少依賴網絡連線。
ER 2 像一個高階協調者,不只是接收「向前走三步」這類命令,而是知道先找物件、再移動、再放到指定位置,過程中亦要確認事情是否完成。機械人開始處理的不是單一動作,而是一段工作流程。
官方影片
Google DeepMind 的官方影片展示 Gemini Robotics 2 如何處理全身動作、精細操作與多部機械人協作。
靈巧操作仍有限制
官方展示中,Gemini Robotics 2 可控制五指機械手完成綁繩、封密實袋等細緻動作,也可配合不同夾具處理物件。不過,Google 承認移動速度與多指精細操作仍有改善空間。
相關報道指出,系統仍需透過遙距操作、人類示範影片與模擬資料訓練,並不是看過一次便能學會所有新工作。現時面向一般開發者提供的主要是 ER 2;全身操控與本地運行模型仍只向早期合作夥伴開放。

「有手有腳」的Robot犯錯後果嚴重
Chatbot 答錯問題,可以關掉頁面重問;機械人誤判指令,卻可能撞到人、弄跌貨物,或在不合適的地方繼續執行任務。當 AI 有了手腳,安全不再只是內容是否準確,而是它能否知道何時應該停下來。
Google 同時推出 ASIMOV-Agentic 安全評測,檢查模型能否拒絕危險指令、辨識任務是否可行,以及在不確定時要求人類介入。真正的問題不是機械人何時能替人搬貨,而是誰可以授權它搬貨、誰能即時叫停、出了問題後可否追查決策過程。



