目前有许多 AI 模型可供选择,老实说,这正是问题所在。几乎每个月都会出现一个新的模型,每个模型都有自己的一套宣传说辞。而大多数人真正想知道的其实很简单:它够快吗?够便宜吗?它真的比他们已经在使用的模型更好吗?
Gemini 3.7 Flash 是谷歌针对那些看重速度、编程,并希望在无需支付旗舰级价格的情况下完成实际工作的人群给出的答案。它并不试图成为地球上最聪明的模型。它是为日常繁重工作而设计的:编写代码、运行多步骤的智能体任务以及快速处理文档。这篇评测将详细介绍它的实际使用体验,它与前代产品 Gemini 3.6 Flash 的对比表现,以及哪些人应该考虑升级。
核心要点
- Gemini 3.7 Flash 是一款专注于编程和智能体(agent)的模型,而不是像 Gemini 3.5 Pro 那样的推理旗舰模型。
- 它是对 Gemini 3.6 Flash 的改进,而不是完全的重新训练,仅在其发布三周后推出。
- 定价非常具有攻击性:每 100 万输入 token 为 0.75 美元,每 100 万输出 token 为 3.75 美元,优惠价将持续到 2026 年底。
- 它非常适合需要快速、便宜、高并发 AI 调用的开发者和业务工作流。
- 它在几乎所有测试任务中都击败了 3.6 Flash,且首发价格减半,这使得大多数用户可以轻松决定升级。
什么是 Gemini 3.7 Flash?
Gemini 3.7 Flash 是谷歌 Gemini 3 Flash 系列中的最新模型,介于体量更大的 Gemini 3.5 Pro(在撰写本文时仍处于延迟发布状态)和体量更轻的 Flash-Lite 模型之间。谷歌将其描述为对 3.6 Flash 底层推理基础的更新,而不是一个从头开始训练的全新模型。它保留了相同的 100 万 token 上下文窗口,支持文本、图像、音频和视频,并允许开发者根据需要速度还是深度来调节“思考”的强度。
对于开发者来说,这意味着你可以获得一个能将整个中等规模代码库容纳在上下文中的模型,而无需为每次请求支付旗舰级别的价格。
对于学生来说,这意味着你可以放入一份长篇 PDF、一套课堂讲义或一堆杂乱的屏幕截图,并在几秒钟(而不是几分钟)内获得一份可用的总结。
对于企业团队来说,这意味着该模型的运行成本足够低廉,可以大规模运行,因此分类整理支持工单或扫描文档等任务不会导致你每月的 AI 账单暴涨。
Gemini 3.7 Flash 核心特性
1. 编程能力
这也是谷歌投入精力最多的地方。Gemini 3.7 Flash 的定位是比 3.6 Flash 更擅长调试,更擅长生成一次运行成功的代码,并且在更少的往复提示词交互中完成应用构建。谷歌自己公布的数据显示,在编程评估中,新模型取得了显著的跨越:与之前的 Flash 模型相比,FrontierCode 得分从 34.4% 提升至 43.6%,DeepSWE 得分从 48.6% 提升至 65.3%。
在实践中,开发者可以让 Gemini 3.7 Flash 根据粗略的描述构建一个 React组件,粘贴堆栈跟踪信息并获得关于出错原因的通俗解释,或者给它一个现有文件并要求在不改变行为的前提下提供更清晰的结构。它不会取代资深工程师的判断,但在任务的“让它跑起来”阶段,它的表现非常不错。
2. AI 智能体与工作流能力
这一代 Flash 模型更大的转变不在于聊天体验,而在于智能体行为。该模型不是一次只回答一个问题,而是为了执行多步骤任务而构建的:检查某些内容、采取行动、检查结果、进行调整,并一直持续下去,直到任务真正完成。
谷歌报告其在 AutomationBench 评估中的得分从 3.6 Flash 的 17.0% 跃升至 3.7 Flash 的 30.4%,这旨在反映模型处理实际业务工作流(而非孤立提示词)的能力。实际应用案例包括:跨多个来源研究某个主题并汇总研究结果、从一批文档中提取关键数据、自动执行重复的格式化或数据输入任务,以及端到端地构建应用的初始版本脚手架。
3. 多模态理解
Gemini 3.7 Flash 在与文本相同的上下文窗口中接收图像、文档、音频和视频。在实际使用之前,这听起来只像是一个技术参数表上的宣传语。你可以向它提供出错 UI 的截图并询问布局有什么问题,上传季度报告中的图表并要求用通俗易懂的语言解释趋势,或者向它输入扫描文档并让它提取出你需要的数据,而无需重新手动输入。
Gemini 3.7 Flash 真实世界测试
基准测试页面上的数字只能说明一部分问题。以下是该模型在人们日常实际交付给它的任务中的常见表现。这些是基于模型记录的功能和行为进行的现实场景演示,而非实验室控制下的基准运行,因此请将它们视为预期表现的参考指南,而非正式评分。
测试 1:网页创建测试
提示词:“为一个 AI 生产力工具创建一个落地页。”
像 Gemini 3.7 Flash 这样针对 Web 开发进行优化的模型,应该在第一次尝试时就生成一个可运行的单页布局:包含首屏展示(hero section)、功能网格和呼吁行动(CTA),且全部使用整洁、可读的代码,而不是一大堆纠缠不清的文件。谷歌特别指出,“首次尝试即可生成可部署、生产就绪的代码”以及完成应用所需的提示词更少,是该模型的核心升级之一。对于开发者来说,实际的好处是减少了在修复结构问题上反复消耗的时间,从而能将更多精力放在实际的润色和内容上。不过,此类级别的模型通常在视觉审美上仍有欠缺——布局结构通常很稳固,但间距、颜色选择和排版往往仍然需要人工调整才能达到真正完工的效果。
测试 2:调试测试
场景:开发者粘贴进一个在某些输入下会报错的函数,但没有解释哪里出错了。
这里的价值不仅在于修复错误,更在于模型是否解释了它发生的原因(why)。谷歌宣称的在应对障碍和更忠实地执行指令方面的改进,直接指向了这类任务。一个经过良好微调的编码模型应该能识别出导致失败的具体代码行或条件,用通俗的语言解释根本原因,并提供一个不会悄悄改变无关行为的修复方案。普通编码模型与优秀编码模型之间的差距通常体现在这里:不在于它能否临时解决症状,而在于其解释是否真的能让开发者学到东西。
测试 3:文档分析测试
场景:上传一份长篇 PDF,例如一份 40 页的报告,并要求提供摘要以及关键数据。
这与谷歌自己的 GDP.pdf 基准测试相契合,该基准专门测试模型处理复杂、长篇文档的能力,谷歌报告 3.7 Flash 的得分达 34.0%,而 3.6 Flash 为 22.0%。在实践中,这种提升通常表现为:更少遗漏埋藏在长文档中部的细节,以及更准确地提取出特定数字,而不是仅仅重写第一页后便给出含糊笼统的概括。在将从密集文档中提取的数据用于重要用途之前,仍然值得对其进行双重检查。目前该级别的模型在这一方面都还不完美。
Gemini 3.7 Flash vs Gemini 3.6 Flash vs Claude
| Gemini 3.7 Flash | Gemini 3.6 Flash | Claude (Sonnet 级别) | |
|---|---|---|---|
| 编程 | 更强 — 43.6% FrontierCode, 65.3% DeepSWE | 34.4% FrontierCode, 48.6% DeepSWE | 强,专注于代码质量 |
| 智能体工作流 | AutomationBench 上为 30.4% | AutomationBench 上为 17.0% | 强,专注于工具使用 |
| 文档理解 | GDP.pdf 上为 34.0% | GDP.pdf 上为 22.0% | 擅长长文档 |
| 速度 | 快,专为高并发设计 | 快,架构略微旧一些 | 中等 |
| 多模态 | 文本、图像、音频、视频 | 文本、图像、音频、视频 | 文本和图像 |
| 成本效率 | 每百万 0.75美元/3.75美元 (优惠价) | 每百万 0.75美元/3.75美元 (同等优惠价) | 每百万约 2-3美元/10-15美元,取决于级别 |
| 最适合 | 高并发编程、智能体、文档处理 | 尚未迁移的用户、常规 Flash 任务 | 细致、微妙的写作与分析 |
谁应该选择 Gemini 3.7 Flash?几乎任何已经在用 3.6 Flash 的人。它在编程、智能体和文档基准测试中的得分都更高,而且谷歌已经将同等的促销定价应用到它身上,因此切换没有任何成本惩罚。
谁应该坚守 Gemini 3.6 Flash?那些工作流已经针对 3.6 Flash 的特定行为进行了微调和测试的团队。在这种情况下,中途切换可能会引入回归问题,值得在完全迁移之前先进行测试。
谁应该选择 Claude 而不是这两者?那些优先考虑细致、逻辑严密的写作、微妙的分析,或者比起纯粹的速度和单 Token 成本更看重语气和判断准确性的任务的人群。
对于大多数日常的编程和智能体工作,3.7 Flash 在相同价格下是功能更强的选择,这使得它在未来成为更合理的默认选项。
Gemini 3.7 Flash 定价与可用性
Gemini 3.7 Flash 的定价为每 100 万输入 token 0.75 美元,每 100 万输出 token 3.75 美元。谷歌已确认这一优惠价格将持续到 2026 年 12 月 31 日,之后将分别上涨至每 100 万 token 1.50 美元和 7.50 美元。在此期间,谷歌也将这一折扣价格延伸到了较旧的 3.6 Flash 模型。
该模型可通过 Gemini API、Google AI Studio、Android Studio、Gemini Enterprise Agent Platform 以及 Gemini Enterprise 应用进行访问。在面向消费者的 Gemini 应用中,它目前正通过 Gemini Spark 推出,这需要订阅 AI Pro 或 Ultra。如果你使用的是免费的 Gemini 计划,你可能还无法直接访问,建议查看谷歌的官方文档以获取最新的推出状态,因为这些状态在发布后往往会迅速变化。
Gemini 3.7 Flash 最佳使用场景
开发者:日常任务的编程助手、出错时的调试帮助,以及可以快速迭代的轻量级应用原型。
学生:将晦涩的概念转化为通俗易懂的语言,总结长篇阅读材料或课堂讲义,并在学习遇到困难时提供常规学习支持。
内容创作者:为文章构思角度、汇集来自多个渠道的研究资料,以及写出初稿以避免面对空白页面无从下手。
企业:处理常规客户支持问题、自动化重复的内部工作流,以及批量处理大批文档且不会产生高昂的单次任务成本。
如何在线体验 Gemini 3.7 Flash
如果你想在不设置 API 密钥或安装任何内容的情况下,了解 Gemini 3.7 Flash 如何处理你的任务,ChatGoat.ai 允许你在同一个地方将它与其他 AI 模型进行并排测试。如果你想在做出选择之前先确定哪个模型真正适合你的工作流,这会非常有用。ChatGoat.ai 涵盖了写作、编程、研究和图像创作,因此你可以将 Gemini 3.7 Flash 与其他选项在同类任务上进行对比,亲眼看看它们的差异。
在 ChatGoat.ai 上体验 Gemini 3.7 Flash 及其他 AI 模型。
常见问题解答
1. 什么是 Gemini 3.7 Flash?
它是谷歌最新的 Flash 级别 AI 模型,专注于编程、AI 智能体工作流以及快速、低成本的表现。
2. Gemini 3.7 Flash 是免费的吗?
访问权限取决于平台。在面向消费者的应用中,它正通过付费的 Gemini Spark 订阅逐步推行;而在 API 端,它是按使用 Token 的量进行计费的。
3. Gemini 3.7 Flash 比 Gemini 3.6 Flash 更好吗?
是的,在大多数测试任务中都是如此。谷歌报告称,在相同的促销价格下,3.7 Flash 在编程、智能体工作流和文档理解方面相比 3.6 Flash 有显著的提升。
4. Gemini 3.7 Flash 适合用来编程吗?
适合。谷歌报告了在编程特定基准测试上相比之前 Flash 模型的显著提升,并且它被设计为在更少的提示词交互下生成更多可部署的代码。
5. 谁应该使用 Gemini 3.7 Flash?
需要快速、实惠的 AI 来进行编程、文档处理或多步骤自动化的开发者、企业和团队。
6. Gemini 3.7 Flash 支持图像吗?
支持,它天生具备多模态能力,除文本外,还支持图像、文档、音频和视频。
7. 企业可以使用 Gemini 3.7 Flash 吗?
可以。除了标准的 API 之外,它还可以通过 Gemini Enterprise Agent Platform 和 Gemini Enterprise 应用进行使用。
8. 如何在线体验 Gemini 3.7 Flash?
你可以通过 Google AI Studio 对其进行测试,或者直接在 ChatGoat.ai 上将其与其他 AI 模型进行对比。
