当所有 Agent 都同意一个错误答案
对照多数投票与辩论实验,分析答案修订、错误相关性和通信成本,并说明 Nexus 复核任务怎样保留独立初答与修改依据。
多智能体辩论允许模型先给出各自的答案,再读取其他答案并修订。这个过程既可能纠正错误,也可能让一个原本正确的成员跟随错误意见。分析辩论,需要同时观察这两个方向。
Du 等人的论文将单次作答、自我反思、多数投票与辩论放在同一实验里比较。这个设计让人能够追问,收益来自多次生成,还是来自答案之间的交互。原论文,第 3 节

概念插画,由 imagegen 生成。
多数投票与辩论改变了不同的东西
多数投票保留各自生成的结果,在最后选择出现次数最多的答案。辩论在中间增加信息交换,每位成员可以根据别人的理由修改自己的结果。前者改变结果选择,后者改变结果本身。
这个区别决定了错误怎样传播。投票可能选中多数成员共有的错误,但不会因讨论而改写少数答案;辩论则可能使少数正确答案说服其他成员,也可能让它消失。最终只保存一个答案,会看不到这些转变。
初次独立生成用于保留差异。这里的独立指生成时尚未读取其他成员本轮答案,不保证统计意义上的错误独立。相同模型可能因为知识缺口或相近的推断方式犯同样的错。给实例起不同名称,不会改变这种相关性。
在共享全部答案以后,后续生成已经条件化于共同材料。此时成员一致,既可能来自有效论据,也可能来自对多数意见的追随。共识需要解释,不能直接作为正确性的标签。
如何阅读论文里的提升
论文主要使用三个 Agent 和两轮辩论,并保持比较中的初始提示与语言模型一致。其算术任务表中,单 Agent 为 67.0%,自我反思为 72.1%,多数投票为 69.0%,辩论为 81.8%;小学数学任务对应为 77.0%、75.0%、81.0% 和 85.0%。这些数值是表 1 的点估计,原表同时给出了不确定性范围。表 1
两个任务中,自我反思的变化方向不同。这已经足以说明“多检查一轮”不能脱离任务讨论。辩论在该实验中表现较好,也不能只依据它与单 Agent 的差距,得出交流机制本身贡献了全部收益,因为它使用了更多生成过程。
多数投票是一个必要对照,它帮助区分增加候选答案与相互修订。但要回答相同预算下选择哪种方法,还需要匹配调用量、token 和耗时。相同模型不等于相同成本。
论文还评估了棋类推理,使用 Stockfish 估计走子的分值。该列与算术正确率的单位不同,不能把它当百分比放进同一张成功率比较图。事实性任务又需要自己的判断方法。一个总分很难代替这些任务层面的解释。
交流成本为何随成员增加
可以用一个简化模型估算通信量。设有 n 位成员,每份答案约 L 个 token,每轮每位成员都读取其他 n−1 份答案。只计算互相读取答案的部分,一轮约需要 n × (n − 1) × L 个输入 token。R 轮则约为 R × n × (n − 1) × L。
这是对全量互读协议的估算,尚未包括原始问题、系统提示、历史记录和输出。它说明在这个假设下,增加成员会同时增加发言者和每人要读的材料。并行调用可以缩短一轮的等待,却不会消除这些读取量;轮与轮之间仍有依赖。
论文讨论了长辩论输入难以被模型完整处理的问题,也尝试用摘要处理交流内容。局限与分析 从产品设计看,摘要能够减少输入,但摘要者会决定哪些异议被保留。成本优化因此也会改变证据分布。
若任务本来就容易,普遍加入多轮辩论会把成本花在不需要的地方。是否启动复核,可以依据任务的错误代价与可验证性设计;具体触发条件仍需实测,不能从论文分数中推导出来。
Nexus 中怎样保留一次判断的变化
Nexus Room 能组织成员分工与复核,公共消息也会影响成员的后续输入。因此,要做独立初答,必须先控制可见材料。两个已经读到同一结论的成员,不能在评测中算作独立复核。Room 指南
一种待验证的组织方式是先在分开的任务输入中收集答案,再将初答与依据交给讨论阶段。每次修订保留旧答案和修改原因。这里描述的是实验协议,不表示普通 Room 已提供盲评隔离。
有参考答案的任务可以统计四类变化,错转对、对转错、保持正确和保持错误。最终准确率相同的两套流程,可能有不同的变化构成。一套主要纠正错误,另一套同时纠正和引入大量错误,后者更值得排查修订依据。
对文件或代码任务,还可以要求修改意见指向可复现的失败、原文位置或测试结果。复核者引用了材料,仍需检查材料是否支持修改。引用数量不能代替证据关系。
汇总时保留未解决分歧,也有技术价值。它让下一次检查知道应该针对哪一项证据,而不是重新执行全部讨论。原论文记录了错误收敛,协作产品应把这种情况留在可检查的历史中,不能只展示最终一致的结论。
本文依据 Du 等人的原论文与 ICML 2024 论文记录。成本公式为本文按全量互读假设推导,Nexus 协议建议尚未作为本文实验执行。消息如何驱动运行,见 AutoGen 解读。