AI 见闻
精选

AR-AGI排行榜

Hacker News (AI)··rzk·约 2 分钟阅读
社区热度 167

ARC-AGI-3排行榜了解排行榜ARC-AGI已经从测量被动流体智能的第一个版本(ARC-AGI-1和2)发展到挑战人工智能动态适应新颖交互环境的ARC-AGI-3。上面的散点图可视化了每项任务的成本与绩效(效率的关键衡量标准)之间的关键关系。

真正的智能不仅仅是解决问题,而是以最少的资源有效地解决问题。解释数据- 推理系统趋势线解决方案在不同推理级别上显示代表同一模型的连接点。这些趋势线说明了推理时间的增加如何影响性能,通常随着思考时间的增加而表现出渐进行为。

- 基本LLM解决方案代表来自GPT-4等标准语言模型的单次推理。5和克劳德3。7、没有扩展推理能力。这些点展示了原始模型的性能,无需额外的推理增强。

- Kaggle Systems解决方案展示了Kaggle挑战赛的竞争级提交内容,在严格的计算限制下运行(120个评估任务的计算预算为50美元)。这些代表了专门为ARC奖设计的有针对性的、高效的方法。

验证策略有关更多信息,请参阅我们的测试政策。排行榜细分注意到仅显示运行所需时间低于10,000美元的系统。

对于无法产生完整测试输出的模型,剩余任务被标记为不正确。标记为“预览”的结果是非官方的,可能基于不完整的测试。1基于部分测试结果和o 1-pro定价的ARC-AGI-2评分估计。2基于Gemini 3 Pro定价的临时成本估计。

模型发布后将重新测试。

原文出处
ARC-AGI Leaderboard

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。