AI Avalon

AI 阿瓦隆

与大语言模型智能体一起玩阿瓦隆

你坐一个位置,其余座位由 Claude、GPT、Gemini、DeepSeek、Grok 担任:讨论、组队、投票、执行任务、刺杀梅林。

开始游戏

默认五个座位:你和四个模型。每局大约需要 15–25 分钟。

开始游戏

实验

9 种配置的 140 局纯 AI 五人游戏,使用 2026 年 4 月的模型复现 Lan 等人(EMNLP 2024)的研究。

阅读结果

实验结果

组合(坏人胜率)完整提示词基础提示词p
GPT-5.4 mini ×546.7% (7/15)93.3% (14/15)0.005
Claude Sonnet 4.6 ×573.3% (11/15)73.3% (11/15)1.00
异构组合(每家提供方一个座位)95.0% (19/20)80.0% (12/15)0.17

每次决策只调用一次模型时,论文所归因于智能体的平衡性只在提示词明确要求时出现:策略指导使 GPT 的坏人胜率从 93% 降至 47%,但对 Claude 没有影响。完整提示词下,坏人在任务 1 的破坏次数为:GPT 0/12、Claude 0/10、异构组合 1/22;基础提示词下则为 10/12、11/11、4/7。

在 README 中查看完整结果、注意事项和数据问题

一轮如何进行

讨论

进行两轮发言。

组队与投票

多数同意即通过;连续五次否决则强制发车。

任务

一张失败票即可让任务失败;三个任务成功后,刺客将寻找梅林。