AI 见闻
精选· 重要性 3/5

选AI模型:同一提示词,11个模型,结果大不同

Hacker News (AI)··toddmorey·约 9 分钟阅读
社区热度 215
中文导读

Netlify与OpenRouter合作,在AI网关和Agent Runners中接入更多模型,并通过实测对比展示不同模型在生成网站时的效果与成本差异。

我们刚刚与 OpenRouter 建立了合作伙伴关系,由此可以提供两项新功能:- 首先,你的项目可以通过我们的 AI Gateway 使用 OpenRouter 上的任何模型。

这意味着,如果你的 Web 应用为最终用户提供基于 AI 推理的功能,那么你现在有更广泛的模型选择,以适应任何任务和预算。- 其次,我们正在扩展通过 Agent Runners 可用的前沿编码模型选择。

Agent Runners 是你在 Netlify 中获得的聊天提示框,可以让你从零开始构建新项目或在现有项目上迭代。现在可用的模型包括近期备受关注的开源模型,如 Kimi K3、GLM 5.2 和 DeepSeek V4,所有人都可以使用。

我们称之为 Agent Runners,因为我们在内部运行一个完整的编码智能体,而不是精简版。到目前为止,我们支持 Claude Agent、OpenAI Codex 和 Gemini CLI,这些智能体针对运行这些提供商的模型进行了优化。

我们为这些智能体提供额外的技能和当前项目的上下文,以便智能体确切知道哪些 Netlify 功能可用(例如 Netlify Database、AI Gateway 或 Identity),以及何时使用和如何使用。

但为了有效驱动各种新模型,我们添加了流行的开源 OpenCode 作为新的智能体选择。但选择越多,问题也随之而来:我如何知道哪个模型适合我?

我是否错过了某个实质更好或更具成本效益(这样我可以用我的积分做更多事)的模型,或者像互联网上说的那样让我惊艳?如今有很多 FOMO(错失恐惧症)。为了给你提供一些见解,以下是我们在一系列模型上运行相同提示词时学到的……所有这些模型现在都可以在 Netlify 上使用。

你可以在这个网站上查看我们测试的所有模型的结果,并附有完整报告。我们测试了什么在 Netlify 内部,我们使用 AXIS 来自动评估模型,这是我们最近开源的工具。我们为 AXIS 提供各种测试用例:构建新网站并迭代的提示词。

我们指示 AXIS 测试哪些智能体和模型,并定义 AXIS 应执行的检查,然后对生成的网站进行评分。这些检查非常关注生成网站的功能正确性,而不是设计,例如:当用户需求需要时,它是否使用了数据库?

在这种情况下,它是否正确使用了 Netlify Database?在简单静态网站就足够的情况下,我们还确保生成的网站没有过度设计,也没有设置数据库。如果某个模型的测试分数落后,我们就不会在 Agent Runners 中提供它。

如果模型经常无法正确应用我们的某项技能,或者功能正常但积分成本似乎过高,那么问题可能出在技能上(在这种情况下,我们会优化该技能)。但这次,我们想为你提供更直接有用的东西:当你使用不同模型(每个模型消耗的积分差异巨大)来构建你的梦想项目时,你会得到什么?

结果看起来如何?我们测试了三个相对简单的用例:- 一个本地咖啡店的网站。LLM 就是喜欢为本地咖啡店建网站!初始提示词很简单,一个没有花哨数据库等的静态网站就足够了。然后我们进行后续提示,要求提供一个简单的预订座位选项,并检查模型如何处理。

- 一个简单的待办事项列表 Web 应用,多个用户可以查看和添加任务。这需要简单的设计,但从一开始就需要共享数据库。然后我们要求支持每个项目可选的照片上传,并检查模型是否使用了正确的 Netlify 原语。

- 一个“我能做什么菜”的 Web 应用,让用户输入家里有什么食材,并使用 AI 建议食谱。网站本身相当简单,但我们希望检查生成的网站是否正确使用我们的 AI Gateway 为用户生成食谱。

对于每个用例,我们将展示生成网站的外观,评论值得注意的问题,并比较每个生成过程消耗的积分。

当然,这将是一个比我们的内部测试套件更主观的测试,但也会非常有趣。我们很想知道你对结果的看法!所有模型都在 Netlify 上使用默认设置运行。

值得注意的是,我们目前默认以低努力模式运行 GPT 5.6 Sol,为你提供比 Opus 更经济的选择,同时仍然提供相当不错的结果(你将在下面看到)。然而,努力设置现在由你控制,我们的默认设置可能会随时间变化。

这篇文章将只涵盖第一个场景:咖啡店的静态页面,而后续文章将专注于超越这个简单用例。即使对于这个简单案例,也有很多值得回顾的地方,所以让我们开始吧。场景 #1:本地咖啡店这是我们的第一个提示词:为一个社区咖啡店构建一个单页网站:营业时间、地址、简短菜单和一张照片。

除非我自己编辑,否则上面没有任何变化。最后一句是作为提示,告诉模型不需要花哨的内容管理系统。我们的默认技能还包括一些 UI 设计指导,主要是为了避免已知的陷阱(例如,现在令人恐惧的紫色 AI 垃圾设计),并让模型思考适合用户需求的视觉形象。

但除此之外,每个模型都可以自由构建它认为我们想要的东西。在我们揭示网站外观之前,这里有一个表格,比较了我们测试的每个模型的积分使用情况。

每个模型运行了三次,点击任何结果都会带你到实际生成的网站!分布相当广泛,是吧?不仅如此:Claude Opus 的平均值被大幅拉高,因为它的三次运行中有一次花费了高达 1,055 积分!(提醒一下,免费计划有 300 积分;

个人计划包含 1,000 积分;专业计划包含 3,000 积分。专业版的额外积分包是每 1,500 积分 10 美元。)那么直接的问题是:Opus 的这笔花费值得吗?其他模型提供了哪些权衡?让我们开始深入探讨。

Claude Opus 5这是那次 1,055 积分运行生成的完整页面(大约是其他任何运行的 4 倍)。说实话,我觉得它很令人愉悦,视觉设计充满细节(考虑一下中间有咖啡豆的“邮票式”元素:那是一个可以动画化的实际文本元素),以及底部的自定义地图。

深色模式开箱即用——去上面链接的实时网站看看吧。当然,我们没有明确向模型提供关于我们咖啡店的任何实际细节(好吧,除了它是“社区”咖啡店,这确实引导所有模型朝某个方向发展)。设计语言很时尚,但可能现在已经有点老套(例如双字体、双色标题),但嘿——我们没有给它任何其他方向。

那么,Opus 的另外两次运行怎么样?

(左边用了 253 积分;右边用了 249 积分)也不错!矢量图形实际上需要模型做很多工作,上面的例子在 LLM 目前能实现的水平上几乎处于前沿(老实说,与图像或文本生成相比,这还不是一个很好的状态)。

至于第一个结果是否真的“好 4 倍”,意见可能不一。但在我做的所有测试中,Opus 确实比其他模型更倾向于过度消耗积分(与其“典型”基线相比)。但这并不保证结果更差或更好。这只是经常发生的事情。

让我们看看其他一些模型,然后反思我们能学到什么。Claude Sonnet 5这是我们的三个候选,平均 143 积分(81 积分 ·

原文出处
Choosing an AI model: one prompt, 11 models, different results

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。

相关阅读