AI 见闻
精选· 重要性 4/5

MUD能否评估LLM?一个99美元的概念验证

Hacker News (AI)··Davisb135·约 5 分钟阅读
社区热度 106
中文导读

CrucibleBench将语言模型置于持久化MUD文本世界中,通过隐藏社交目标和可测量行为评估模型,揭示了LLM作为评判者的不稳定性,为AI行为评估提供了低成本、可解释的新方法。

旧世界,新智能体。CrucibleBench将语言模型置于一个持久的MUD(多用户地牢)中——一个NPC拥有记忆、信任会积累、错误会留下痕迹的文本世界——并根据隐藏的社交目标,对模型在50回合内的行为进行评分。

横向思维与过时技术任天堂的横井军平用这个短语描述一种设计理念:采用成熟、廉价、易于理解的技术,并以新的方式使用它。CrucibleBench将其应用于AI评估。我们不是从逼真的模拟或浏览器自动化开始,而是从一个MUD开始:多用户地牢,早期互联网的持久文本世界。

其限制正是关键:有限的命令空间使得幻觉行为可被检测,带有信任和怀疑状态的NPC提供明确的社会反馈,而运行内的持久性意味着拿走的物品保持被拿走,赢得的信任保持被赢得。我们选择MUD并非因为它迷人,而是因为它的限制使行为变得可测量。

旧限制解决现代测量问题静态基准测试衡量模型在孤立状态下的知识。它们不衡量模型在需要赢得信任、信息受关系限制、直白提问会引发怀疑的情境下的行为。-01可枚举的动作空间7种命令类型、12个房间、14个物品。

幻觉动作和错误房间的交互可被检测,动作效率可被测量。

-02明确的社会反馈4个NPC携带信任和怀疑状态(0-100),这些状态会根据对话而变动:模型可以在一次运行中适应这种反馈,也可能失败。-03运行内持久性拿走的物品保持被拿走;赢得的信任保持被赢得。

每次运行都会留下完整的、可重放的探索和规划记录。核心发现关乎测量,而非排名评分栈内的一个LLM评判组件将排行榜重新排序了多达六个位置,而所有聚合可靠性统计数据却保持沉默。我们在两种评分配置下报告每个结果,并将这种分歧视为论文最具普遍性的发现。

评判者消融重排榜首四个评分维度中有两个通过对话分类器路由,该分类器与独立评判者在每个模型上的一致性从21.7%到84.8%不等,这种不稳定性是聚合κ=0.04从未揭示的。移除依赖分类器的维度后,六个排名超出了场景采样噪声(90%配对块自举)。

变动最大的模型与分类器属于同一模型家族。使用LLM评判者的基准测试应报告每个受试者的一致性以及评判者消融下的排名稳定性,而不仅仅是聚合可靠性。1-5分制下的平均分数,按分类器最小化的小计排序。

每个模型运行50次:5个种子×2个目标×5次重复,温度0.3,通过OpenRouter进行计费验证。

排名是探索性的;前八名之间的置信区间大幅重叠。完整方案、置信区间和统计数据见白皮书。可在记录中阅读的失败三种失败模式,每种都通过状态机遥测算法检测,无需评判者参与。对话循环是每个测试模型(包括前沿模型)的主要模式。

-对话循环 14-66%的前沿运行在一次运行中对单个NPC使用八个或更多谈话命令。智能体重复失败的对话方式而非适应:这是持久世界中支持智能体重复自身的表亲。-错误房间交互 在基础模型中严重谈话命令被回答“这里没人”。

揭示了丢失的世界状态跟踪,类似于调用不在范围内的API。Grok 4是唯一有显著发生率的前沿模型(12%)。-探索瘫痪 选择性,基础模型为主二十多个回合中只探索两个或更少房间,或连续五个查看命令。

信息收集从未转化为目标导向的行动。这是什么,不是什么这是- 持久世界行为评估的概念验证。- 一个带有隐藏社交目标和基于规则机制的紧凑MUD。- 一种揭示可测量、可解释失败模式的方法。- 完整工件发布:650份记录、源代码、评分代码和完整计费导出。

这不是- 通用社会智能的经过验证的衡量标准。- 前沿模型的权威排行榜。

- 然而,它能预测现实世界智能体部署的结果。- 声称LLM评判者无用(相反,证据表明它们需要每个受试者的审计)。第二阶段将成为一个基准测试。帮助我们构建它。CrucibleBench是一项独立的研究工作。

第二阶段正在为校准而构建;临时低/中/高预算现已发布,最终分配将遵循试点数据和预注册。有三种参与方式:资助它·临时3500美元信封;构建它·环境、目标、校准;运行它·校准后试点队列有问题,或对私人评估感兴趣?

请写信至contact@cruciblebench.ai

原文出处
Can a MUD evaluate LLMs? A $99 proof of concept

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。

相关阅读