最近看了一篇google DeepMind團隊發表的AI滑鼠新想像的文章,我是覺得蠻有趣的但是demo使用起來不太好用,整理如下:
滑鼠游標伴隨我們的電腦螢幕已經超過半個世紀。無論軟體介面如何演進,那個小小的箭頭幾乎沒有改變。近期,Google DeepMind 發表了探討 AI 互動未來的文章,試圖賦予游標全新的能力:讓它不只「知道你指到什麼」,還能理解「這對你為何重要」。
DeepMind 的四大互動原則
目前的 AI 工具多半被侷限在獨立的視窗中,使用者必須刻意切換過去,把問題「餵」給它。DeepMind 的新概念是讓 AI 主動融入既有的工作流。
- ****維持流暢 (Maintain the flow):****AI 應該跨應用程式運作。例如在 PDF 點擊直接生成摘要貼入信件,或在食譜上圈選直接計算食材份量,而不是要求使用者繞道將資料複製貼上到 AI 專屬視窗。
- ****邊指邊講 (Show and tell):****現今的 AI 高度依賴精準的文字提示詞。新型態的 AI 游標能擷取游標周邊的「視覺與語意脈絡」,使用者只要指著某張圖或某段程式碼,AI 就能給出協助。
- ****善用「這個」與「那個」 (Embrace "This" and "That"):****人類習慣用手勢配合簡短指令溝通(例如「幫我處理這個」)。當 AI 能結合「螢幕脈絡 + 指向動作 + 語音」,就能聽懂自然且簡短的複雜需求。
- ****把像素轉為可操作實體 (Pixels → Actionable entities):****游標不再只是停留在像素上,而是識別出背後的結構化實體(如日期、地點、物件)。影片暫停時出現的餐廳畫面,可以直接變成可互動的訂位連結。
聽起來很美,但現實辦公室適用嗎?
這套願景確實解決了目前 AI 工具「缺乏當下脈絡」的痛點。過去我們總是要花大量時間截圖、寫敘述,才能讓 AI 搞懂「我現在看的這個系統報錯是什麼意思」。如果系統能自己讀取脈絡,效率將大幅提升。
然而,經過實測與反思,這種「指著螢幕講話」的互動模式,在實際的企業環境與日常辦公中,存在難以克服的缺點:語音互動並不務實。
在開放空間、辦公室或會議中,對著電腦講話不僅尷尬,還會互相干擾。再者,語音辨識的容錯率與「點完還要講話」的多餘動作,反而會拉長操作流程,拖慢工作節奏。
更接地的解決方案:AI 動態右鍵選單
相較於語音指標,更適合日常辦公與大型系統軟體的解法,其實是「AI 動態右鍵選單」。
當使用者在任何畫面按下右鍵時,由 AI 根據當下指到的物件(錯誤訊息、表格資料、圖片)即時生成對應的選項:
- 右鍵點擊一段系統錯誤代碼:自動出現「解釋此錯誤」、「尋找近期類似解法」、「將環境資訊複製給工程師」。
- 右鍵點擊報表上的異常數據:自動出現「摘要異常原因」、「與前期資料比較」、「生成趨勢圖表」。
為什麼右鍵選單更好?
- ****零學習成本:****點擊右鍵是所有使用者的肌肉記憶,不需重新教育使用者「如何對螢幕下指令」。
- ****精準且可控:****選單提供明確的選項供點選,使用者可以審視與挑選,不需要「猜」AI 能不能聽懂。
- ****符合企業規範:****系統端可依據使用者的角色與權限,預先過濾或生成合適的選單動作,更容易符合資安與合規要求。
- ****無痛整合:****不需要改變輸入法或索取麥克風權限,單靠攔截網頁前端的右鍵事件就能漸進式導入。
DeepMind 提出的「讓系統自動補足脈絡」與「將像素轉為實體」是極具價值的核心精神。但在實作落地上,結合傳統的右鍵選單,或許才是真正能走入千家萬戶與企業內部的最佳 AI 互動入口。--
📢 聲明: 本文 AI 寫作比例達 90% 以上,作為作者意志之延伸工具。
