Google DeepMind 在 2026 年 7 月 21 日一口氣發表三款 Gemini 模型:新主力 Gemini 3.6 Flash、把成本壓到更低的 3.5 Flash-Lite,以及專門找出並修補資安漏洞的 3.5 Flash Cyber。名單裡唯獨少了外界等最久的那一個——Gemini 3.5 Pro 仍未上線。我要下的判斷是:Google 的旗艦難產已經不是意外,而是既成事實;它乾脆把主戰線改打「便宜、快、夠用」的 Flash 線。對台灣的開發者與中小企業,這反而是好消息,因為你手上真正在跑的多數任務,本來就用不到旗艦模型。
先把三款模型和價格擺清楚
- Gemini 3.6 Flash(新主力):官方掛牌價為每百萬 token 輸入 1.5 美元、輸出 7.5 美元,輸出價從前一代 3.5 Flash 的 9 美元往下調。Google 宣稱它在 Artificial Analysis Index 上比 3.5 Flash 少用約 17% 的輸出 token,多步流程也少走幾輪推理與工具呼叫。據 DeepMind 模型卡,知識截止推進到 2026 年 3 月,脈絡窗 100 萬 token、單次輸出上限 6.4 萬 token,輸入支援文字、圖片、音訊與影片。
- Gemini 3.5 Flash-Lite(最省):官方定價每百萬 token 輸入 0.3 美元、輸出 2.5 美元,定位是同級中最省成本的一款。
- Gemini 3.5 Flash Cyber(拿不到):微調來找出並修補資安漏洞,但 Google 明說只會透過 CodeMender 開放給政府與信任夥伴,屬限量試用。一般企業與開發者現在拿不到,別把它算進今年的規劃。
分寸先講清楚:上面的效能與 token 效率數字全是 Google 官方宣稱,尚未經第三方廣泛獨立驗證;Google 自己的模型卡也註明評測方法已改版,數字與過去的 Gemini 模型卡不能直接對照。定價則是官方掛牌價,可以點連結查到。至於「長程工程任務最多省 65% token」這類更漂亮的說法,是特定單一測項上的宣稱,不是整體平均,別直接拿去做預算。
唯獨沒有 3.5 Pro,這才是真正的重點
三款模型都不是旗艦,這件事比任何一項跑分都值得注意。回顧這條線:Google 在 5 月的 I/O 發表 3.5 系列並預告 Pro 版 6 月推出,6 月先跳票,市場流傳的 7 月 17 日也沒守住,據 Bloomberg 報導是寫程式能力未達內部目標。到了這次三款齊發,它依然缺席。Google 產品負責人 Logan Kilpatrick 只表示正在與夥伴測試、希望盡快落地,官方部落格同時透露已經展開 Gemini 4 的預訓練。
一邊是旗艦交不出來、一邊已經在練下一代,訊號其實很清楚:Google 短期不打算靠旗艦贏,改用 Flash 線的價格與效率把開發者先守住。 這是很務實的選擇,也是一次策略轉彎——從「比誰最聰明」轉成「比誰每完成一件事最便宜」。
對台灣的開發者,這是好消息
外電不太會替台灣算的是這一段。台灣多數導入 AI 的實際場景,是客服回覆、文件摘要、工單分類、批次資料清理、電商文案這種「量大、單題不難、對延遲敏感」的任務。這些任務用旗艦模型跑,八成的錢是浪費在你根本沒用到的推理深度上。
而這次降價的殺傷力是複利的:輸出單價從 9 美元降到 7.5 美元(約降 17%),再疊上官方宣稱少用約 17% 的輸出 token,兩者相乘才是你帳單上真正的變化。 對一天要跑幾十萬次呼叫的客服或批次流程,這種等級的下修是實質的,不是行銷數字。
這也不是 Google 一家的動作,而是整個產業的同一個轉向。我在寫 Fireworks 募 15 億美元那篇時就提過,資本正在押注「用小而特化的模型跑自家任務,比一路呼叫前沿大模型划算」;開源陣營的 Kimi K3 把「逼近前沿又便宜」推到新高度,也是同一條曲線。Google 這次等於承認了同一件事:能力軍備競賽之外,還有一場成本競賽在打,而後者跟你的損益表關係更大。
但有兩件事,我不建議省
第一,真正吃推理深度的任務別硬省。 複雜程式重構、長鏈多步推理、需要嚴謹數學或法遵判斷的任務,Flash 級模型省下來的錢,很可能會用「錯一次要人工重做三小時」還回去。這類任務要嘛等旗艦,要嘛現在就用別家已經上市可用的前沿模型——這也是前作那個結論的延續:別把關鍵流程押在還沒上市的承諾上。
第二,廠商宣稱的 token 效率,一定要自己實測才算數。 17% 是整體指數上的平均值,你的提示詞風格、輸出格式、是否開推理模式,都會讓實際落差很大。而且換模型本身有遷移成本:提示詞要重調、評估題要重跑、輸出格式可能要重新校準。先在自己的資料上跑一週 A/B,看的是「每完成一件正確任務花多少錢」,不是「每百萬 token 多少錢」。
一套 awareness 級的分流框架
在把任務往 Flash 級模型搬之前,用這四個問題自問,答案越偏「是」,越適合搬:
- 對錯標準寫得出來嗎? 能用一句話定義什麼叫「答對」(分類正確、摘要涵蓋三個要點)的任務,最適合下放,因為你能自動化評測、換模型時心裡有底。
- 錯一次的代價多大? 錯了只是使用者重問一次,可以放心省;錯了會出帳、會發信給客戶、會影響法遵,就別省。
- 後面有沒有人或流程接得住? 有人工覆核或規則檢查當第二道關卡的環節,容錯高很多。
- 能不能只搬一部分? 最務實的做法是「路由」而不是「全押」:把八成的簡單請求丟給 Flash 級,剩下兩成難題再往上升級。怎麼在多家模型與價格帶之間做選型與成本控管,我整理在企業 AI 工具選型與 AI 成本優化。
一句話的判斷
Google 這次交出來的不是最強的模型,而是最划算的模型。對還在等 3.5 Pro 的人,該調整的是預期:旗艦什麼時候到,Google 自己都還沒給日期;但「便宜好用」的那條線,今天就能用、而且真的變便宜了。 把你的任務清單攤開,該省的大方省,不該省的一毛都別省——這比追每一次版本號更新,對你的帳單有用得多。
常見問題
Gemini 3.6 Flash 比 3.5 Flash 便宜多少?
官方掛牌價是每百萬 token 輸入 1.5 美元、輸出 7.5 美元,輸出價從前一代 3.5 Flash 的 9 美元往下調,約降 17%。Google 另外宣稱同樣任務下輸出 token 用量比 3.5 Flash 少約 17%(官方宣稱,未經第三方廣泛驗證)。兩者相乘才是你帳單上的實際變化,但真實省多少要拿自己的任務跑過才算數。
Gemini 3.5 Pro 到底什麼時候上線?
到 2026 年 7 月 24 日為止,Google 沒有給出新時程。產品負責人只表示正在與合作夥伴測試、希望盡快推出。這款旗艦從 6 月一路延到 7 月,連 7 月 21 日三款齊發都沒有它,官方同時透露已展開 Gemini 4 的預訓練。實務建議:不要把排程押在沒有官方掛牌的日期上。
我該把現有流程整批換成 Gemini 3.6 Flash 嗎?
不建議一次全換。換模型有遷移成本——提示詞要重調、評估題要重跑、輸出格式可能要校準。務實做法是先挑一個量大、對錯標準清楚的任務做 A/B,跑一到兩週,比較的指標是「每完成一件正確任務花多少錢」而不是單價。確認沒退步再逐步擴大。
哪些任務還是不該用 Flash 級模型?
複雜程式重構、長鏈多步推理、需要嚴謹數學或法遵判斷的任務,先別省。這些任務錯一次的代價,通常遠高於你省下的 token 費用。判斷方式很簡單:錯了只要使用者重問一次,可以省;錯了會出帳、發信給客戶、影響法遵,就用能力更強的模型,或保留人工覆核那一關。
Gemini 3.5 Flash Cyber 一般公司可以用嗎?
現在不行。Google 明確表示這款專門找出並修補資安漏洞的模型,只會透過 CodeMender 開放給政府與信任夥伴,屬於限量試用階段,並非公開可用。企業規劃資安自動化時,先別把它算進今年可用的選項;等 Google 公布公開時程再評估。
參考來源
- Google 官方部落格:Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber(定價、17% 輸出 token 宣稱、Flash Cyber 限量試用、Gemini 4 預訓練)
- Google DeepMind:Gemini 3.6 Flash 模型卡(知識截止 2026 年 3 月、100 萬 token 脈絡窗、6.4 萬 token 輸出上限、評測方法變更說明)
- TechCrunch:Google releases three new Gemini models, but no 3.5 Pro(三款齊發但旗艦缺席、Logan Kilpatrick 說法)
- 9to5Google:Google launches Gemini 3.6 Flash and 3.5 Flash-Lite, teases Gemini 4(輸出價自 9 美元下調、知識截止、上架通路與跑分)
- PPC Land:Google cuts Gemini Flash prices as 3.6 uses 17% fewer output tokens(17% 為 Artificial Analysis Index 全指數量測、65% 為單一測項)
- GitHub Changelog:Gemini 3.6 Flash is now available in GitHub Copilot(2026/07/21 起於 Copilot 逐步開放,企業方案需管理者啟用)