在 3.6 版本推出三週後,Gemini 3.7 Flash 以更聚焦的定位登場:成為程式碼代理、網頁建置與知識工作快速且經濟的核心支柱。Google 強調更高的首次通過準確率、更嚴格的指令遵循,以及更有紀律的多步驟工具使用。這點很重要,因為實際生產成本來自重試與監督,而非僅是表面上的每秒處理速度。該模型的初始定價為每百萬輸入代幣 0.75 美元、每百萬輸出代幣 3.75 美元,顯示其目標是搶占過去用戶混合使用較便宜模型做路由與較大模型處理複雜呼叫的工作負載份額。
報告的評估結果顯示實質進展:在 FrontierCode 1.1 Main 的程式碼準確率提升(43.6% 對比 34.4%)及 DeepSWE v1.1(65.3% 對比 49.0%),網頁生成能力提升,WebDev Arena 的 Elo 分數更高(1588 對比 1538),文件推理表現更佳(GDP.pdf 34.0% 對比 22.0%),以及真實工作流程完成度提升(AutomationBench 30.4% 對比 17.0%)。對實務者而言,重點不僅是分數,而是操作效益:減少部分實作、降低事後除錯,且更多功能能一次通過,尤其當模型在小型代理圖中協調工具呼叫時。
開發者體驗是 3.7 Flash 力求完善的環節。模型會更早提出澄清問題,能從阻礙中恢復而不偏離計畫,且更穩定地遵守安全防護。在程式碼代理中,這表現為更穩定的函數呼叫與堅定的逐步規劃——當代理必須檢查代碼庫、執行測試與修補程式碼時尤其有用。在網頁 UI 生成方面,當提供截圖或設計系統作為上下文時,設計一致性大幅提升。構建知識工作流程的團隊會發現解析 PDF 與將洞見匯總成即時圖表或狀態摘要時摩擦減少,且需要的補救提示更少。
採用建議:將 3.7 Flash 作為延遲敏感代理與重複性工程任務的預設選擇;僅在模糊推理、高風險決策或新穎領域時升級至更大型模型。務必衡量完整工作流程:平均工具呼叫深度、每任務重試次數、代碼編譯/測試通過率,以及 UI 與設計規範的一致性。如果您的組織使用 Gemini Spark 與 Workspace 工具,預期在日常整合、草稿撰寫與狀態更新上會有生活品質的提升。企業部署時,除了價格外,還要驗證政策執行與審計能力,尤其在敏感領域有更嚴格的安全防護。


