Gemini 3.5 Flash:它對代理成本真正帶來的改變

Diagram of an agentic workflow with parallel subagents sharing a cached prompt block routed to Gemini 3.5 Flash

分享這篇文章:

Gemini 3.5 Flash 對代理式與編碼工作流程之所以重要,主要是因為一項標題價格未傳達的成本機制:在代理迴圈中,系統提示與工具定義的快取命中率,比每 Token 費率更能決定你的實際支出。那些依照廣告所稱每百萬 Token 輸入 1.50 美元、輸出 9.00 美元來編列預算,卻沒有為快取而設計的團隊,最後收到的帳單會與他們的估算大相逕庭。這個單一架構細節對你的成本模型而言,比模型是否「快 4 倍更快。」

真正的成本槓桿是快取命中率,而不是標價

Google 自己的發布定價講述了一個值得仔細解讀的故事。Gemini 3.5 Flash 推出時的價格為每百萬個輸入詞元 1.50 美元、每百萬個輸出詞元 9.00 美元,約為上一代 Flash 的三倍;鑑於 Flash 級模型本應是廉價選項,開發者社群普遍認為這一定價失當。Google 在數週內修正了方向,但修正本身並不是有趣之處。有趣的是,快取輸入詞元的價格為每百萬個 0.15 美元,較標準輸入費率。

在真正的代理式工作流程中,這項折扣就是整個關鍵。執行平行子代理的代理框架會在每次呼叫時重複相同的系統提示與工具定義。如果你的架構沒有將這些重複的權杖透過快取處理,你就是在為每次呼叫之間從未改變的內容支付全額費用;而在任何具有多個子代理的實際生產規模下,這段重複的系統提示會成為帳單上最主要的項目,而不是每個新使用者回合的邊際成本。我曾審閱過代理產品的成本模型其中某個團隊用標價做出的粗略估算,預測每月帳單會比在正確實作後、具備快取意識的架構實際產生的費用高出三到四倍。這裡的工程判斷很直接:對於代理式使用案例,不要依據宣傳的每權杖價格來比較前沿模型。應該在建模你的實際快取命中率之後,比較每個已完成任務的有效成本,因為那才是經得起生產流量考驗的數字。

速度不等於推理深度

Flash 的優勢所在

Gemini 3.5 Flash 的真正強項在於工具使用與程式設計任務的吞吐量。它產生輸出權杖的速度約為同類前沿模型的四倍,並且在代理式與程式設計基準測試中勝過上一代的 Pro 等級,包括 Terminal-Bench 2.1 和 MCP Atlas;後者是函式呼叫與工具編排基準測試,而它目前在該測試中領先。對於由許多短工具呼叫往返所定義的工作負載——規劃、呼叫工具、觀察、重新規劃——這種速度優勢會在整個迴圈中累積,其方式是單次推理基準測試永遠無法呈現的。

退步之處

同一份發布資料顯示,Flash 在純推理基準測試以及長上下文檢索方面,落後於上一代的 Pro 級別。這不是缺陷,而是一種設計取捨,但在「以前沿速度、半價成本」的行銷框架中,這一點會被忽略。如果你的流程包含某個步驟,需要針對真正困難的問題進行深入、單次完成的分析性推理,卻因為 Flash 在技術堆疊其他地方是快速、便宜的預設選項而把該步驟也路由到 Flash,就會恰恰在品質最重要的那個步驟上悄悄降低品質。正確的架構會把這視為路由決策,而不是模型替換:代理迴圈步驟交給 Flash,推理負載重的步驟則升級到更重量級的模型。

發布順序傳達了什麼訊號

Google 在這一代先推出 Flash,早於 Pro,顛倒了其通常的順序,並明確將 3.5 Flash 定位為面向長期時域代理式任務的模型,而專注於推理的 Pro 等級仍需數週才會推出。這樣的排序本身就是一個值得解讀的訊號,應視為一項架構決策,而不僅僅是產品發布:該供應商押注於近期大多數生產價值將來自便宜、快速且具備工具能力的模型來執行代理迴圈,而不是來自原始推理深度的漸進提升。除了模型之外,Google 也推出了一個Managed Agents API,可啟動一個完整代理,並具備隔離的執行環境以及跨呼叫的持久狀態。目前正在維護自家代理沙盒與工作階段狀態基礎設施的團隊,現在有了一個真正需要評估的自建或採購決策,而不再只是個假設性的問題。

經驗豐富的團隊有哪些不同做法

從這類模型獲得良好成果的團隊,會先對其快取架構進行建模,再比較各供應商之間的標價,因為代理工作負載的實際成本取決於其自身系統設計特有的提示重用模式,而不是定價頁面上的某個數字。他們也會抵抗誘惑,不會只因為某個模型速度快且剛推出,就把它設為所有用途的預設模型,而是保留一個路由層,將推理負荷較重的步驟送往其他地方。在 SIRAYA,那些在之後避免成本意外的部署採用 Gemini 3.5 Flash 的部署,是那些將發布當天的定價視為暫定、並將快取設計視為必要事項的部署;鑑於發布後定價本身變動得如此迅速,這被證明是正確的直覺。這個教訓不只適用於這個特定模型:當一個新的、快速且看似便宜的模型出現時,真正重要的架構決策是你的系統如何重用上下文,而不是定價頁面上印著哪個數字。

分享這篇文章:

若要了解更多博彩產業的洞察與技術解決方案,請訂閱我們的官方 Telegram 頻道
Telegram:@siraya_official

若要了解更多遊戲產業的洞察與技術解決方案,請訂閱我們的官方 Telegram 頻道。您也可以聯絡我們以獲得 免費 試用!

看看 SIRAYA 能做些什麼 為您!

您可以成為下一個精彩故事。讓我們向您展示如何做到!