开始游戏
默认五个座位:你和四个模型。每局大约需要 15–25 分钟。
开始游戏
与大语言模型智能体一起玩阿瓦隆
你坐一个位置,其余座位由 Claude、GPT、Gemini、DeepSeek、Grok 担任:讨论、组队、投票、执行任务、刺杀梅林。
默认五个座位:你和四个模型。每局大约需要 15–25 分钟。
开始游戏9 种配置的 140 局纯 AI 五人游戏,使用 2026 年 4 月的模型复现 Lan 等人(EMNLP 2024)的研究。
阅读结果| 组合(坏人胜率) | 完整提示词 | 基础提示词 | p |
|---|---|---|---|
| GPT-5.4 mini ×5 | 46.7% (7/15) | 93.3% (14/15) | 0.005 |
| Claude Sonnet 4.6 ×5 | 73.3% (11/15) | 73.3% (11/15) | 1.00 |
| 异构组合(每家提供方一个座位) | 95.0% (19/20) | 80.0% (12/15) | 0.17 |
每次决策只调用一次模型时,论文所归因于智能体的平衡性只在提示词明确要求时出现:策略指导使 GPT 的坏人胜率从 93% 降至 47%,但对 Claude 没有影响。完整提示词下,坏人在任务 1 的破坏次数为:GPT 0/12、Claude 0/10、异构组合 1/22;基础提示词下则为 10/12、11/11、4/7。
在 README 中查看完整结果、注意事项和数据问题进行两轮发言。
多数同意即通过;连续五次否决则强制发车。
一张失败票即可让任务失败;三个任务成功后,刺客将寻找梅林。