關鍵數字:Google DeepMind 推出全新「embodied reasoning」(具身推理)模型 Gemini Robotics ER 2,旨在突破現有機器人在真實物理世界中的局限。
具身推理:機器人的高階大腦
Gemini Robotics ER 2 被定位為機器人的「高階大腦」,專門負責對話、理解物理世界以及規劃多步驟任務,並將低階的動作執行交由視覺-語言-動作(VLA)模型處理。這使得機器人在日常環境中不僅能精準定位,更能像人類一樣快速反應、掌握時機。
即時決策:擺脫停頓與思考延遲
新一代模型整合了 Gemini Live API,透過雙向串流端點大幅降低延遲。這讓機器人能夠在執行動作的同時同步進行思考,擺脫過去常見的「停頓與思考」延遲感。Google DeepMind 也與波士頓動力(Boston Dynamics)合作展示相關應用,透過 Spot APIs 指揮 Spot 執行拿取爆米花等互動任務。
精準掌握任務進度與時間點
機器人過去面臨的一大難題是「如何判斷任務已經完成」。Gemini Robotics ER 2 在影片理解與進度追蹤上有顯著躍升,帶來兩大核心能力:連續進度分類(Progress Classification):透過分析影片畫面的五個階段(0% 至 100%),讓機器人擁有即時的現場情境意識,能在發生失誤時即時調整或重試,無須重啟整個工作流程。精準時刻尋找(Precision Moment-Finding):能夠以高達 91.3% 的準確度和極低的時間誤差(0.96 秒平均絕對距離),精準鎖定關鍵事件發生的影格(例如倒咖啡的最佳停止時機),以次秒級的反應速度確保操作安全。
多機協作與強化的安全機制
單一機器人難以應付所有環境需求,Gemini Robotics ER 2 因此支援多機器人協作,讓不同型態的機器人(如輪式機器人與雙足人形機器人)透過共用的語意理解來互相交接並完成複雜任務,例如串聯 Apptronik 的 Apollo 2 與 Franka F3 Duo 共同作業。此外,在安全性方面,新模型在「安全指令遵循」與「人類鄰近度」評測中表現優異。當偵測到人類靠近時,人形機器人能夠自動暫停,並在區域安全後自動恢復作業,大幅提升人機協作的安全性。
從產業面來看,Gemini Robotics ER 2 不僅是技術上的突破,更是實體 AI 應用的重要里程碑。它不僅解決了機器人在物理世界中的多項挑戰,還為多機協作和安全性樹立了新的標準。未來,我們可以預期看到更多智慧機器人在工業、服務業乃至家庭中的廣泛應用。
行動呼籲
隨著 Gemini Robotics ER 2 的推出,智慧機器人的應用前景更加廣闊。你是否對這項技術感興趣?不妨進一步探索 Google AI Studio,了解如何將這項前沿技術應用於你的生活或工作中。
本文改寫整理自公開新聞來源,原始報導由T客邦發布。
常見問題 FAQ
Gemini Robotics ER 2 是什麼?
Gemini Robotics ER 2 是 Google DeepMind 推出的全新「具身推理」模型,旨在提升機器人在真實物理世界中的決策能力和多機協作能力。
Gemini Robotics ER 2 的主要特點有哪些?
Gemini Robotics ER 2 的主要特點包括即時決策、多機器人協作、精準掌握任務進度與時間點,以及強化的安全機制。
Gemini Robotics ER 2 如何提升機器人的安全性?
Gemini Robotics ER 2 在「安全指令遵循」與「人類鄰近度」評測中表現優異,當偵測到人類靠近時,人形機器人能夠自動暫停,並在區域安全後自動恢復作業,大幅提升人機協作的安全性。
※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。








