AI 见闻
精选· 重要性 4/5

谷歌发布Gemini 3.6 Flash、3.5 Flash-Lite及3.5 Flash Cyber模型

Hacker News (AI)··logickkk1·约 7 分钟阅读
社区热度 739
中文导读

谷歌推出三款新模型:3.6 Flash提升编码与多模态性能并降低token消耗,3.5 Flash-Lite主打高速低成本,3.5 Flash Cyber专攻网络安全漏洞检测与修复,同时透露Gemini 4预训练已启动。

推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber构建生产级 AI 智能体的开发者和客户需要更高的 token 效率、更低的延迟和更可靠的性能。

我们的 Flash 系列模型旨在平衡效率与质量,以支持智能体工作流的规模化扩展。在 Gemini 3.5 Flash 的基础上,我们推出了新的 Gemini 模型:- 3.6 Flash:我们的主力模型,在编码、知识工作和多模态性能上表现更佳。

根据 Artificial Analysis Index,其输出 token 使用量相比 3.5 Flash 减少了 17%,在 Datacurve 的 DeepSWE 等基准测试中,我们观察到降幅高达 65%,且每个输出 token 的成本更低。

- 3.5 Flash-Lite:我们最快、最具成本效益的 3.5 级别模型,根据 Artificial Analysis Index,每秒可输出 350 个 token,在智能体工作流中的表现也显著优于前代 Flash-Lite。

- CodeMender 中的 3.5 Flash Cyber:成功的网络安全应用需要将模型与智能体基础设施精心编排。我们推出了一种新型、高效、专注于网络安全的专用模型,与我们的 CodeMender 代码安全智能体相结合,在前沿领域提供具有竞争力的性能。

除了今天的发布,Gemini 3.5 Pro 目前正在与合作伙伴进行测试,我们计划在准备就绪后尽快广泛提供。

与此同时,我们的团队已经在专注于构建下一代模型。我们已启动了迄今为止最雄心勃勃的预训练运行——针对 Gemini 4,并对进展感到兴奋。

3.6 Flash:比 3.5 Flash 更高效、质量更好Gemini 3.6 Flash 直接基于开发者和客户对 3.5 Flash 的反馈构建。3.6 Flash 不仅在编码和知识工作上实现了提升,同时还显著提高了 token 效率。

例如,在 Artificial Analysis Index 上,我们看到 3.6 Flash 消耗的输出 token 比 3.5 Flash 少 17%。它完成多步骤工作流所需的推理步骤和工具调用也更少。

这种增强的效率还与低于 3.5 Flash 的价格相结合。以每百万输入 token 1.50 美元、每百万输出 token 7.50 美元的价格,3.6 Flash 降低了每个智能体任务的总成本,使智能体的构建和运行更具成本效益。

在 OSWorld 验证任务(API)中,3.6 Flash 相比 3.5 Flash 展现出更好的 token 效率和更低的冗长性。

即使在更高效的情况下,3.6 Flash 在多个用例中的性能相比 3.5 Flash 也有所提升:- 3.6 Flash 在 DeepSWE(49% 对比 37%)中实现了更高的精度,减少了不必要的代码编辑和执行循环,

并在 MLE Bench(63.9% 对比 49.7%)的 ML 研究中显示出显著改进。- 它在计算机使用能力上有所提升,如 OSWorld-Verified(83.0% 对比 78.4%)所示。

计算机使用现在通过 Gemini API 和 Gemini Enterprise 成为内置的客户端工具。- 它在知识工作方面优于 3.5 Flash,如 GDPval-AA v2(1421 对比 1349)等基准测试所示。

Hebbia 和 Harvey 等客户发现它在文档解析、图表和数据分析以及报告起草等多模态任务上特别有能力。客户报告称,3.6 Flash 在成本和质量上均向前迈进了一步,在复杂工作流和基于知识的任务中平衡了 token 效率、准确性和速度。

安全构建3.6 Flash 在化学、生物、放射和核(CBRN)以及网络攻击滥用领域配备了增强的前沿安全防护措施。这些防护措施使模型对越狱攻击的抵抗力大幅增强。同时,该模型经过训练,尽量减少对有益用途的拒绝。

更多信息请参阅 3.6 Flash 模型卡。3.5 Flash-Lite:专为扩展智能体工作流而构建除了 Flash,我们还发布了 Gemini 3.5 Flash-Lite,专为低延迟任务以及高吞吐量对开发者工作流至关重要的任务(如智能体搜索和文档处理)而设计。

3.5 Flash-Lite 是 3.5 系列中最快的模型。根据 Artificial Analysis 的测量,它以每秒 350 个输出 token 的速度运行。

定价为每百万输入 token 0.3 美元、每百万输出 token 2.5 美元,且质量显著优于 3.1 Flash-Lite。3.5 Flash-Lite 为运行高吞吐量生产流量的开发者和客户提供了强大的性价比。

3.5 Flash-Lite 以低于 3.5 Flash 的延迟执行高容量任务。3.5 Flash-Lite 支持智能体系统的高效扩展。在各个思考级别上,该模型显著优于 3.1 Flash-Lite。

根据工作负载,开发者可以配置模型,以最低和低思考级别优先处理高容量任务的低延迟、低成本执行,或使用更高思考级别处理多步骤子智能体工作负载。该模型现在还将计算机使用作为内置工具,以可靠地支持跨平台的这些智能体任务。

它在编码和智能体任务(如 Terminal-Bench 2.1,54% 对比 31%)、长上下文(如 GDM-MRCR v2,72.2% 对比 60.1%)以及现实世界任务执行(如 GDPval-AA v2,1140 对比 642)方面均有显著提升。

事实上,在许多智能体和编码评估中,3.5 Flash-Lite 甚至优于 3 Flash,包括 SWE-Bench Pro(54.2% 对比 49.6%)和 OSWorld-Verified(74.0% 对比 65.1%),

使其成为 2.5 和 3 Flash 工作负载的更快、更强大的选择。3.5 Flash-Lite 的早期客户强调其独特的速度、智能和成本效率组合,用于扩展智能体工作流和数据处理任务。有关该模型的更多信息,请参阅 3.5 Flash-Lite 模型卡。

CodeMender 中的 3.5 Flash Cyber:高效发现和修复漏洞AI 模型已经能够比当前系统修复漏洞的速度更快地发现安全漏洞。应对这一日益增长的威胁需要一种高能力且高效的软件安全方法。

Flash 的性能和效率使其成为大规模检测、验证和修补代码安全问题的理想基础。Gemini 3.5 Flash Cyber 基于 3.5 Flash 构建,并针对发现和修复网络安全漏洞进行了微调,每个 token 的价格低于更大的模型。

在 CodeMender 中,多个 3.5 Flash Cyber 智能体协同工作生成一份综合报告,3.5 Flash Cyber 在流行基准测试 CyberGym 上达到了前沿的竞争性能。

鉴于该技术的双重用途性质,我们采取了审慎的方法来部署 3.5 Flash Cyber。该模型将很快通过 CodeMender 作为有限访问试点计划的一部分,独家提供给政府和受信任的合作伙伴。这将使前线防御者能够在关键漏洞被利用之前发现并修复它们,同时减轻更广泛的滥用风险。

3.6 Flash 和 3.5 Flash-Lite:立即开始使用3.6 Flash 和 3.5 Flash-Lite 从今天起可用:- 对于开发者,可通过 Google AI Studio 和 Android Studio 中的 Gemini API 使用。

3.6 Flash 也可在 Google Antigravity 中使用。

请参阅开发者指南开始使用。- 对于企业,可在 Gemini Enterprise 智能体平台中使用。3.6 Flash 也可在 Gemini Enterprise 应用中使用。- 对于所有人,可通过 Gemini 应用使用。

3.5 Flash-Lite 也正在 Google 搜索中推出。当您开始使用 3.6 Flash 和 3.5 Flash-Lite 构建时,我们欢迎您的反馈以改进未来的 Gemini 模型,并期待很快发布 3.5 Pro。

原文出处
Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。

相关阅读