Google 在 7 月 21 日發布 Gemini 3.6 Flash。若只看 Benchmark,很容易錯過它真正想解決的問題:減少 Agent 在流程裡繞路。

AI Agent 完成一項工作,往往需要讀取資料、拆解問題、呼叫工具、檢查結果,再處理錯誤。模型只要多走幾個不必要的步驟,Token、等待時間與失敗機率就會一起增加。

從一次回答走向完整任務

這次強化的方向集中在 Coding、Knowledge Work、多模態,以及需要工具協作的多步驟任務。

在程式任務裡,重要的不只是生成正確程式碼,也包括少做不必要的修改、降低編譯失敗與來回除錯,甚至在只被要求診斷時,不要擅自修改檔案。Agent 的風險不只來自回答錯誤,也可能來自它在不該行動時採取行動。

多模態方面,模型支援文字、圖片、音訊與影片輸入,也鎖定圖表判讀、視覺藍圖轉換及複雜版面理解。不過,功能性程式碼與符合人類視覺偏好仍是兩件事;要用它製作前端畫面,清楚的設計規範依然重要。

單價之外,更該看任務效率

真正值得觀察的不是「每百萬 Token 便宜多少」,而是模型能否少產生 Token、少呼叫工具、少做幾輪修正,最後降低每個成功任務的成本。

官方與第三方測試可以提供方向,卻不能直接代表自己的產品環境。資料、工具、權限與驗收條件不同,結果就可能不同。

如果要在真實工作流程測試,我會同時記錄:

  • 任務成功率。
  • 輸入、輸出與推理用量。
  • 工具呼叫與重試次數。
  • 完成任務所需時間。
  • 人工修正比例。
  • 每個成功任務的實際成本。

這些數字會比單次回答或一張 Benchmark 排名,更接近工作模型的真正價值。

參考資料