2026 CES 熱議 AI 落地焦慮,Google 物理 AI 給出關鍵答案

Picture of Hannah Lo

Hannah Lo

Marketing

一月於 Las Vegas 剛落幕的 2026 年 CES,依然是全球科技圈最熱鬧的秀場。

今年對我們來說尤為特別:思想科技 Master Concept 在 CES 期間舉辦了2場交流活動,與來自全球的合作夥伴和開發者們進行了深度的交流,收穫頗豐。感謝每一位到場的朋友,期待明年 CES 再相見!

在與大家的熱烈交流中,我們不僅收穫了友誼,更敏銳地捕捉到了產業風向的劇變。如果說前兩年的 CES 是大模型的「參數軍備競賽」,那麼 2026 年的主題只有一個:「落地」。據新華社報導,今年 CES 的核心關鍵字依然是 AI,但討論的重心已經從「模型能力」轉向了「產品能力」。我們看到,AI 不再僅僅是螢幕裡的對話框,它開始有了「身體」,從終端裝置到人形機器人,「物理 AI」(Physical AI)正在成為新的技術爆發點。

然而,從酷炫的 Demo 到真正可用的產品,中間隔著巨大的技術鴻溝: 機器人如何像人一樣「看懂」複雜的動態環境? 通用機器人如何不僅能動,還能「思考」? AI 語音助理如何做到不再「插嘴」?

針對這一趨勢,Google 恰好在近期展示了三項關鍵技術,完美建構了一個從感知到決策,再到互動的完整循環:

  1. D4RT:解決了「看」的問題(全知感知)
  2. Gemini Robotics:解決了「動」的問題(決策與執行)
  3. Live API:解決了「聽與說」的問題(自然互動)

1. D4RT 解決「看」的問題:給機器裝上四維之眼

現實世界是動態的,傳統 3D 視覺難以應付移動中的物體。Google DeepMind 推出的 D4RT 將機器視覺升級至四維(3D 空間 + 時間),完美解決這個痛點:

  • 300 倍速的「上帝視角」:捨棄繁瑣的模型拼湊,直接處理視訊串流。處理速度比傳統方法快上 120 到 300 倍,讓即時、高精準的動態空間感知成為可能。
  • 深度的空間理解:不只是「錄影」,更能預測像素未來的 3D 位置、精準追蹤被遮擋的物體,成為機器人在複雜動態環境中最可靠的導航儀。

2. Gemini Robotics 1.5:解決「動」的問題:不僅手巧,更要心靈

看清了世界,下一步就是「行動」。2026 CES 上的機器人展品雖然琳瑯滿目,但痛點依然明顯:如何處理長序列的複雜任務?如何讓一套技能適配不同的機型?

Google 給出的答案是 Gemini Robotics 1.5 系列模型,它讓機器人從「執行指令」進化到了「理解任務」。

  • 「三思而後行」的思維鏈:這是與傳統機器人最大的不同。當接到「把衣服按顏色分類」的指令時,Gemini Robotics 1.5 不會莽撞行動,而是會先進行「多層次思考」(Multi-level thinking):先理解分類規則(白放白桶,彩放黑桶),再規劃動作(抓起紅色毛衣),甚至會調整抓取姿勢。這種「想清楚再動手」的能力,讓它在處理繁雜耗時的任務時更加穩健。

  • 一通百通的「跨具身學習」:這是開發者的一大福音。Gemini Robotics 1.5 展現了驚人的跨具身(Cross-embodiment)能力。在 ALOHA 2 機器人上學會的技能,可以直接遷移到雙臂 Franka 甚至人形機器人 Apollo 上。這意味著,企業不再需要為每一款機器人單獨訓練模型,通用機器人的落地門檻被大幅降低。

3. Gemini 2.5 Flash Live API 解決聽與說的問題:像人一樣「察言觀色」

當 AI 有了身體,能看能動之後,最後一步就是與人類共處。在 CES 的個人終端展區,裝置端 AI 成為主流,但傳統的「喚醒詞」互動顯得極其笨拙。

Google 推出的 Gemini 2.5 Flash Live API,用更符合直覺的方式重塑了人機互動。

  • 懂得察言觀色的「主動音訊」(Proactive Audio):這是為了解決「亂插嘴」的尷尬。Live API 引入了語意意圖分析。它能區分什麼是「向裝置發出的指令」,什麼是你在自言自語或跟朋友聊天。 例如你說「今天咖啡太苦了」,它會保持安靜;但如果你接著問「幫我記一下買糖」,它才會回應。這種「去暗號化」的體驗,讓 AI 真正融入了生活背景,而不再是一個需要時刻提防觸發的工具。
  • 隨時打斷(Barge-in): 基於 WebSocket 的雙向連線,讓你能夠隨時打斷 AI 的長篇大論。這種「插話」的自由度,加上 24kHz 的高保真語音輸出,讓與機器人的對話不再像是下指令,而更像是一場自然的交談。

2026 年的 CES 是一個分水嶺。它告訴我們,AI 正在經歷一場從「雲端大腦」到「具身智慧」的質變。

在這個過程中,Google 展示的三項技術恰好拼上了這塊拼圖的最後幾角:D4RT 讓 AI 看懂了動態的每一個瞬間,Gemini Robotics 讓 AI 學會了像人一樣思考和行動,而 Live API 則讓 AI 學會了如何得體地與人交流。

這不僅是技術的秀場,更是未來商業落地的藍圖。對於所有身處這一浪潮中的企業而言,理解並利用好這套「感、動、聽」的循環,或許就是通往下一個時代的入場券。

未來已來,不再是科幻電影裡的想像,而是正在發生的工程現實。

歡迎您與我們聯絡
我們會協助您取得最佳解決方案!

歡迎您與我們聯絡
我們會協助您取得最佳解決方案!

思想科技 Master Concept
微信公众号:Master_Concept