Gemini 的跨應用自動化將 Android 重新定義為執行環境。用戶不再需要在購物、地圖、餐飲和票務應用中逐一點擊,而是委派多步驟目標,並可在透明的進度中隨時介入。具螢幕感知的推理與影像解析降低指令摩擦——展示清單、行程或產品照片,代理人便會彙整選項、填寫表單並排隊等待最終確認。這不是置於應用之上的聊天機器人,而是一種作業模式,應用程式公開可靠的動作與狀態,代理人在用戶監督下串連執行。
對產品領導者而言,關鍵績效指標堆疊改變了。轉換不再是點擊或會話,而是「代理人完成的任務」。實務工作是公開深層連結、意圖與保留狀態(購物車、座位圖、會員 ID)的結構,讓 Gemini 能組合路徑而非脆弱的爬蟲。預期在流程例行且結構化的場景中早期提升——餐飲預訂、地面交通、重複訂購與活動票券——而複雜且例外頻繁的任務仍為混合型(代理草稿,用戶最終確認)。人機迴路中的批准時刻成為新的結帳點:必須清晰、可撤銷且快速。
企業將此視為受控的行動面。角色與政策必須隨任務流轉:哪些帳戶、付款工具與資料範圍可由代理人觸及?日誌、重播與收據成為審計的必備文檔。同時,用戶信任依賴於限制:不可逆步驟需明確確認,代理人摘要內容需有清楚來源,且年齡或司法管轄限制功能需有護欄。安全團隊應將代理人視為特權自動化客戶端,需實施最小權限、速率限制與異常偵測。
在裝置端,體驗延伸至手錶與未來眼鏡,使批准可在環境中免持完成,並擴展至更大折疊螢幕,透過 Gemini 筆記本進行研究與草擬。這形成「微批准、大準備」迴圈:手腕快速確認簡單步驟,折疊螢幕則進行更深入的簡報、行程或內容組合。現在試點的團隊應定義代理人就緒流程、設置完成分析,並設計尊重情境(時間、地點、身份)且可逆的批准用戶體驗,避免用戶回到手動點擊。


