Google 在 7 月 21 日發布 Gemini 3.6 Flash。若只看 Benchmark,很容易錯過它真正想解決的問題:減少 Agent 在流程裡繞路。
AI Agent 完成一項工作,往往需要讀取資料、拆解問題、呼叫工具、檢查結果,再處理錯誤。模型只要多走幾個不必要的步驟,Token、等待時間與失敗機率就會一起增加。
從一次回答走向完整任務
這次強化的方向集中在 Coding、Knowledge Work、多模態,以及需要工具協作的多步驟任務。
在程式任務裡,重要的不只是生成正確程式碼,也包括少做不必要的修改、降低編譯失敗與來回除錯,甚至在只被要求診斷時,不要擅自修改檔案。Agent 的風險不只來自回答錯誤,也可能來自它在不該行動時採取行動。
多模態方面,模型支援文字、圖片、音訊與影片輸入,也鎖定圖表判讀、視覺藍圖轉換及複雜版面理解。不過,功能性程式碼與符合人類視覺偏好仍是兩件事;要用它製作前端畫面,清楚的設計規範依然重要。
單價之外,更該看任務效率
真正值得觀察的不是「每百萬 Token 便宜多少」,而是模型能否少產生 Token、少呼叫工具、少做幾輪修正,最後降低每個成功任務的成本。
官方與第三方測試可以提供方向,卻不能直接代表自己的產品環境。資料、工具、權限與驗收條件不同,結果就可能不同。
如果要在真實工作流程測試,我會同時記錄:
- 任務成功率。
- 輸入、輸出與推理用量。
- 工具呼叫與重試次數。
- 完成任務所需時間。
- 人工修正比例。
- 每個成功任務的實際成本。
這些數字會比單次回答或一張 Benchmark 排名,更接近工作模型的真正價值。