AI同行评审是让多个AI模型相互评审和评分对方论点的实践,类似于应用于AI输出的学术同行评审。与其信任单一模型的答案,不如让每个模型的主张由其他模型进行评估,经过跨模型审查的论点获得信心。其理论基础在于已知的使用单一LLM作为评审的局限性:研究文献记录了立场偏见(偏向于首先出现的答案)、冗长偏见(奖励较长的答案而不考虑质量)和自我增强偏见(模型偏好自己的输出)。在多个模型之间分散评估并匿名化被评估的论点可以稀释任何一个评审的特异性偏见。由于不同模型的幻觉倾向不同,虚构或不支持的主张通常会被其他模型低评分,因此持续低的跨模型评分标记出需要人工验证的主张。Argumentree.AI通过让每个可用模型匿名评分其他模型的论点来实现这一点,揭示哪些主张得到广泛支持,哪些是薄弱或有争议的。它增强了人类判断,而不是取代它。
AI同行评审让模型相互评分,而不是信任一个评审。单一LLM评审显示出立场、冗长和自我增强偏见——在多个模型之间匿名分散评分,稀释这些偏见并揭示薄弱或幻觉的主张。
在学术界,主张并不是因为其作者自信而被接受——而是由独立的同行进行审查,他们评判推理和证据。AI同行评审借鉴了这一原则:与其信任一个模型的答案,不如让多个模型相互评审和评分对方的论点。经过跨模型审查的主张获得信心;其他模型评分较低的主张会被标记。
一个诱人的捷径是让一个强大的模型评分输出——“LLM作为评审”的模式。问题是:关于LLM评审的研究记录了系统性偏见,使得一个评审不可靠。
两个设计选择可以抵消这些偏见:在多个模型之间分散评分,以及匿名化被评估的论点。它们共同评判内容,而不是作者,并平均化任何单一模型的特性。
每个可用模型独立贡献支持/反对论点。
论点被匿名化,因此没有模型知道哪个是自己的。
评分在模型之间分散,而不是集中在一个评审上。
广泛支持=信心;持续低评分=需要验证的薄弱或幻觉主张。
一个模型声称“这个库在设计上是内存安全的”,并附有自信的引用。在匿名同行评审下,其他模型对该论点评分较低——几个人指出引用的保证并不涵盖不安全的互操作路径。低的跨模型评分标记该主张以供人类检查,而不是让一个自信的模型毫无挑战地通过。
每个可用模型匿名评分每个其他模型的论点——因此薄弱的主张无法隐藏在一个模型的自信后面。
论点来自多个模型,而不是单一来源
每个模型在不知道作者的情况下评分每个其他模型的论点
广泛支持的论点上升;持续低评分的论点被标记
潜在的幻觉表现为跨模型的不一致以供验证
AI同行评审是多个AI模型相互评审和评分对方论点的过程,类似于应用于AI输出的学术同行评审。与其信任一个模型的答案,不如让每个模型的主张由其他模型进行评估。经过跨模型审查的论点获得信心;其他模型评分较低的主张被标记为薄弱或可能的幻觉。
使用一个LLM作为评审已知存在偏见。关于LLM作为评审的研究记录了立场偏见(偏向于首先出现的答案)、冗长偏见(奖励较长的答案而不考虑质量)和自我增强偏见(模型偏好自己的输出)。在多个模型之间分散评估并匿名化被评估的论点可以稀释任何单一评审的特异性偏见。
如果一个模型知道哪个论点是自己的,自我增强偏见可能会使其给自己更高的评分。在评分之前匿名化论点去除了这一线索,因此每个模型评判内容而不是作者。结合多个模型的评分进一步平均化任何单一模型的立场或冗长特性,产生比单一评审更平衡的信号。
它有助于揭示幻觉。由于不同模型的幻觉倾向不同,一个模型的虚构或不支持的主张通常会被其他模型低评分。持续低的跨模型评分是一个红旗,表明该主张需要人工验证。这是一个不一致检测信号,而不是保证——如果每个模型都共享相同的错误,同行评审将无法捕捉到。
不。AI同行评审旨在优先考虑和增强人类判断,而不是取代它。它告诉你哪些主张在模型之间得到广泛支持,哪些是有争议或薄弱的,以便人类可以将验证重点放在最重要的地方。最终决策和高风险验证仍然是人类的责任。