目前有很多 AI 模型可供選擇,老實說,這正是問題的一部分。幾乎每個月都會出現一個新模型,每個都有一堆宣傳特點。大多數人真正想知道的事情其實更簡單:它夠快嗎?夠便宜嗎?以及它是否真的比他們已經在使用的模型更好?

Gemini 3.7 Flash 是 Google 針對那些在乎速度、程式編寫,並希望在不支付旗艦級價格的情況下完成實際工作的人所提出的解決方案。它並不想成為地球上最聰明的模型。它是為了日常繁重的工作而設計的:編寫程式碼、執行多步驟的代理人任務,以及快速處理文件。這篇評測將帶您了解其實際的使用體驗、它與直接前代產品 Gemini 3.6 Flash 的對比表現,以及哪些人應該考慮升級。

重點摘要

  • Gemini 3.7 Flash 是一款專注於程式編寫和代理人任務的模型,而不是像 Gemini 3.5 Pro 那樣的推理旗艦模型。
  • 它是 Gemini 3.6 Flash 的改進版本,而非完全重新訓練的模型,在後者發布僅三週後便推出。
  • 定價非常具侵略性:每 100 萬輸入 token 為 0.75 美元,每 100 萬輸出 token 為 3.75 美元,此推廣價格將持續到 2026 年底。
  • 對於需要快速、便宜且高吞吐量 AI 調用的開發人員和業務工作流程來說,它非常強大。
  • 它在幾乎所有測試任務中都擊敗了 3.6 Flash,且價格僅為其推出時推廣價的一半,這使得對大多數用戶來說升級是一個簡單的決定。

什麼是 Gemini 3.7 Flash?

Gemini 3.7 Flash 是 Google Gemini 3 Flash 系列中的最新模型,介於較重型的 Gemini 3.5 Pro(在撰寫本文時仍延期中)和較輕型的 Flash-Lite 模型之間。Google 將其描述為 3.6 Flash 底層推理基礎的更新,而不是一個從頭開始訓練的全新模型。它保留了相同的 100 萬 token 上下文窗口,能處理文字、圖像、音訊和影片,並允許開發人員根據需要速度還是深度來調大或調小「思考」程度。

對於開發人員來說,這意味著您獲得了一個可以將整個中型程式碼庫納入上下文的模型,而無需為每次請求支付旗艦級的價格。

對於學生來說,這意味著您可以放入一份長篇 PDF、一組課堂筆記或一堆凌亂的螢幕截圖,並在幾秒鐘(而非幾分鐘)內獲得可用的摘要。

對於企業團隊來說,這意味著該模型的運行成本足夠便宜,可以大量使用,因此分類支援工單或掃描文件等任務不會讓您每月的 AI 帳單暴增。

Gemini 3.7 Flash 主要特色

1. 程式編寫能力

這正是 Google 投入最多心力的地方。與 3.6 Flash 相比,Gemini 3.7 Flash 被宣傳為更擅長除錯、更擅長首次嘗試就產出真正可運行的程式碼,並且能在更少的往返提示詞中完成應用程式的建構。與之前的 Flash 模型相比,Google 自身公布的數據在程式編寫評測中顯示出顯著的躍升:FrontierCode 上為 43.6% 對比 34.4%,DeepSWE 上為 65.3% 對比 48.6%。

在實務中,開發人員可以要求 Gemini 3.7 Flash 根據粗略的描述構建 React 組件,貼上堆疊追蹤並獲取有關損壞原因的白話解釋,或者交給它一個現有文件並要求在不改變行為的情況下提供更乾淨的結構。它不會取代資深工程師的判斷,但在任務的「讓它運作起來」階段,它的表現相當不錯。

2. AI 代理人與工作流程能力

這一代 Flash 模型更大的轉變不在於對話體驗,而在於代理人行為。該模型不是一次回答一個問題,而是旨在執行多步驟任務:檢查某些內容、對其採取行動、檢查結果、進行調整,並持續進行直到任務真正完成。

Google 報告其 AutomationBench 評估有所躍升,從 3.6 Flash 的 17.0% 提高到 3.7 Flash 的 30.4%,這旨在反映模型處理真實業務工作流程(而非孤立的提示詞)的能力。實際範例包括跨多個來源研究某個主題並彙整研究結果、從一批文件中提取關鍵數據、自動化重複的格式化或數據輸入任務,以及端到端地構建應用程式的第一個版本。

3. 多模態理解

Gemini 3.7 Flash 允許在與文字相同的上下文窗口中接收圖像、文件、音訊和影片。在您真正使用它之前,這聽起來可能只像是規格表上的一行字。您可以交給它一張損壞 UI 的螢幕截圖,並詢問版面配置出了什麼問題;上傳季報中的圖表並要求它用白話解釋趨勢;或者為它提供一份掃描文件,讓它提取您需要的特定數據,而無需重新輸入任何內容。

Gemini 3.7 Flash 真實世界測試

基準測試頁面上的數字能告訴您的資訊有限。以下是該模型在人們日常實際交付的任務中所表現出的傾向。這些是基於模型已記錄的功能和行為的真實場景模擬,而非實驗室控制的基準測試運行,因此請將其視為預期表現的指南,而非正式評分。

測試 1:網站建立測試

提示詞:「為一個 AI 生產力工具建立一個到達網頁。」

針對網頁開發進行調整的模型(如 Gemini 3.7 Flash),應該能在首次嘗試時就產生一個可運作的單頁版面:包含主視覺區、功能網格和行動呼籲,所有程式碼都乾淨且具可讀性,而非一個巨大混亂的檔案。Google 特別指出「首次嘗試即可部署、可用於生產環境的程式碼」是該模型的核心升級之一,並且在達到完成應用程式所需的提示詞更少。對於開發人員來說,實際的好處是減少了來回修正結構問題的時間,能將更多時間花在實際的拋光和內容上。此級別的模型通常仍力有未逮之處在於視覺品味——版面結構通常很穩固,但間距、顏色選擇和排版往往仍需要人工修飾,才能看起來真正完工。

測試 2:除錯測試

場景:開發人員貼上一個在某些輸入下會拋出錯誤的函式,但沒有解釋出了什麼問題。

這裡的價值手不僅僅在於修復 Bug,還在於模型是否解釋了為什麼會發生這種情況。Google 聲稱的在適應障礙與更忠實地遵循指令方面的改進,直接指向了這類任務。一個調整良好的程式編寫模型應該要能識別出導致失敗的特定程式碼行或條件、用通俗的語言解釋根本原因,並提供不會暗中改變無關行為的修復方案。一般程式編寫模型與優秀模型之間的差距通常呈現在這裡:不在於它是否能修補症狀,而是在於其解釋是否能真正讓開發人員學到東西。

測試 3:文件分析測試

場景:上傳一份長篇 PDF(例如 40 頁的報告),並要求提供摘要以及關鍵數據。

這符合 Google 自身的 GDP.pdf 基準測試,該測試專門測試模型處理複雜長篇文件的能力,Google 報告 3.7 Flash 在此得分為 34.0%,而 3.6 Flash 為 22.0%。在實務中,這種躍升通常表現為更少遺漏埋藏在長文件中間的細節,以及更精確地提取特定數據,而不是只重寫第一頁然後給出模糊的概括。在將從密集的文檔中提取的任何數字用於重要事情之前,仍然值得雙重檢查。目前這個級別的模型在此方面都還不完美。

Gemini 3.7 Flash vs Gemini 3.6 Flash vs Claude

Gemini 3.7 FlashGemini 3.6 FlashClaude (Sonnet 級別)
程式編寫更強 — 43.6% FrontierCode, 65.3% DeepSWE34.4% FrontierCode, 48.6% DeepSWE強大,專注於程式碼品質
代理人工作流程在 AutomationBench 上為 30.4%在 AutomationBench 上為 17.0%強大,專注於工具使用
文件理解在 GDP.pdf 上為 34.0%在 GDP.pdf 上為 22.0%擅長長文件
速度快速,專為高吞吐量設計快速,架構稍微較舊中等
多模態文字、圖像、音訊、影片文字、圖像、音訊、影片文字和圖像
成本效益每 100 萬 $0.75/$3.75 (推廣價)每 100 萬 $0.75/$3.75 (相同促銷價)每 100 萬約 $2-3/$10-15,視級別而定
最適合大批量程式編寫、代理人、文件工作尚未遷移的用戶、一般的 Flash 任務謹慎、細緻的寫作與分析

誰應該選擇 Gemini 3.7 Flash?幾乎所有已經在使用 3.6 Flash 的人。它在程式編寫、代理人和文件基準測試中的得分更高,而且 Google 已將相同的促銷定價延伸至此,因此切換使用沒有成本損失。

誰應該繼續使用 Gemini 3.6 Flash?工作流程已針對 3.6 Flash 的特定行為進行調整 and 測試的團隊,在專案進行到一半時進行切換可能會引入退化(regressions),在完全遷移之前值得先進行測試。

誰應該選擇 Claude 而不是這兩者?那些優先考慮謹慎、推理良好的寫作、細緻的分析,或語氣和判斷正確與否比單純的速度或每個 token 成本更重要的任務的人。

對於大多數日常的程式編寫和代理人工作, 3.7 Flash 是在相同價格下功能更強大的選擇,這使得它成為未來更明智的預設選擇。

Gemini 3.7 Flash 定價與可用性

Gemini 3.7 Flash 的定價為每 100 萬輸入 token 0.75 美元,每 100 萬輸出 token 3.75 美元。Google 已確認此推廣定價將持續到 2026 年 12 月 31 日,之後將分別上漲至每 100 萬 token 1.50 美元和 7.50 美元。與此同時,Google 也將此優惠定價延伸至較舊的 3.6 Flash 模型。

該模型可透過 Gemini API、Google AI Studio、Android Studio、Gemini Enterprise Agent Platform 和 Gemini Enterprise 應用程式取得。在消費型 Gemini 應用程式中,它目前正透過 Gemini Spark 推出,這需要訂閱 AI Pro 或 Ultra。如果您使用的是免費的 Gemini 方案,您可能還無法直接存取,值得查看 Google 官方文件以了解最新的推出狀況,因為這在發布後往往會迅速變化。

Gemini 3.7 Flash 最佳使用場景

開發人員:用於日常任務的程式編寫助手、程式損壞時的除錯協助,以及可供快速迭代的應用程式原型。

學生:將艱澀的概念分解為白話文、摘要長篇閱讀材料或課堂筆記,以及在您卡住時提供一般學習支援。

內容創作者:為作品腦力激盪切入點、整合來自多個來源的研究,並寫下初稿,這樣您就不用盯著空白頁面發呆。

企業:處理日常客戶支援問題、自動化重複的內部工作流程,以及處理大量文件,而無需承受高昂的單次任務成本。

如何在線上體驗 Gemini 3.7 Flash

如果您想看看 Gemini 3.7 Flash 如何處理您自己的任務,而無需設定 API 金鑰或安裝任何軟體,ChatGoat.ai 提供了一種可以與其他 AI 模型一併測試的方法。如果您想在確定使用某個模型之前,先了解哪一個最適合您的工作流程,這會非常有用。ChatGoat.ai 涵蓋了寫作、程式編寫、研究和圖像創作,因此您可以在同類型的任務上將 Gemini 3.7 Flash 與其他選項進行對比,親自看看其差異。

在 ChatGoat.ai 上嘗試 Gemini 3.7 Flash 和其他 AI 模型。

常見問題

1. 什麼是 Gemini 3.7 Flash?

它是 Google 最新款的 Flash 級別 AI 模型,專注於程式編寫、AI 代理人工作流程,以及快速、低成本的效能。

2. Gemini 3.7 Flash 是免費的嗎?

存取權取決於平台。在消費型應用程式中,它正透過付費的 Gemini Spark 訂閱方案推出;在 API 方面,則以按 token 付費的方式提供。

3. Gemini 3.7 Flash 比 Gemini 3.6 Flash 更好嗎?

是的,在大多數測試任務中。Google 報告在相同的促銷價格下,其在程式編寫、代理人工作流程和文件理解方面相較於 3.6 Flash 有顯著進步。

4. Gemini 3.7 Flash 適合用來編寫程式嗎?

是的。Google 報告在程式編寫專屬基準測試中,該模型相較於上一個 Flash 模型有顯著提升,且旨在透過更少的提示詞產出更多可部署的程式碼。

5. 哪些人應該使用 Gemini 3.7 Flash?

需要快速且實惠的 AI 來進行程式編寫、文件處理或多步驟自動化的開發人員、企業和團隊。

6. Gemini 3.7 Flash 支援圖像嗎?

是的,它原生支援多模態,除了文字之外,還支援圖像、文件、音訊和影片。

7. 企業可以使用 Gemini 3.7 Flash 嗎?

是的。除了標準的 API 之外,它還可透過 Gemini Enterprise Agent Platform 和 Gemini Enterprise 應用程式取得。

8. 我該如何在線上體驗 Gemini 3.7 Flash?

您可以透過 Google AI Studio 進行測試,或者直接在 ChatGoat.ai 上將其與其他 AI 模型進行對比。