Hugging Face 發布了 WebAI 的基礎層:包含 200 多個 Apache-2.0 授權的 WebGPU 核心與一個簡潔的 JavaScript 載入器,可直接從 Hub 下載、準備並執行這些核心。開發者不必完全依賴伺服器 GPU 或單一瀏覽器執行環境,而能在瀏覽器中組合版本化且可檢視的運算操作——如矩陣乘法、層正規化、Softmax、卷積、量化原語等。這帶來實際效益:代理動作與 UI 附近的推理可在本地執行,大幅降低請求延遲、節省 API 成本,並將用戶資料保留在裝置端。隨著更多應用邏輯轉移至客戶端,瀏覽器成為可信賴且可攜的 AI 執行層,而非僅是展示平台。
技術上,這個突破在於封裝:每個核心都是一個包含契約清單、WGSL 範本、正確性測試與基準案例的程式庫。這意味著你可以在不閱讀著色器程式碼的情況下,理解輸入、輸出、支援類型與形狀規則。不同變體針對各種形狀、裝置與瀏覽器功能,Fleet——一個瀏覽器內的基準測試套件——從真實硬體收集正確性與效能證據以指導選擇。早期比較顯示多數工作負載有顯著加速,某些特定模式更有超乎預期的提升。重點不在單一數字,而是建立一套持續且基於證據的優化機制,面對 GPU、驅動程式與瀏覽器的複雜現實。
對產品與平台團隊而言,決策焦點從「瀏覽器能否執行?」轉向「瀏覽器應該執行哪些部分?」記憶體上限、模型量化、快取與冷啟動編譯時間都很重要,伺服器優雅回退也不可忽視。合理的設計模式是混合式:將隱私敏感的前處理、輕量解碼或快速後處理保留在瀏覽器;將重量級計算或長上下文任務升級至伺服器。有了核心契約與社群證據,團隊能試行原生瀏覽器代理,實現快速反應、離線容忍且預設隱私,同時透過選擇性卸載與遙測維持可靠性與可觀察性。


