什么是集体人工智能?

集体人工智能是让多个人工智能模型独立推理同一问题,构建支持和反对某一主张的论点,然后对其他模型的论点进行评分的实践。当单一人工智能模型可能自信地错误时——著名的例子是2023年Mata诉Avianca案中,一名律师提交了引用ChatGPT虚构的法院案例的法律简报——集体人工智能将这些错误作为分歧呈现。Argumentree.AI通过将每个模型的推理结构化为论点树,并让所有可用模型匿名相互评分来实现这一点。高共识是信心信号;分歧是更高价值的信号,指向人类验证确切需要的地方。共识从未证明真理——它揭示了需要关注的地方。

多人工智能研究 · 主题中心

什么是
集体人工智能?

集体人工智能让多个人工智能模型独立推理,构建论点并相互评分——因此共识和更重要的分歧变得可见。这是对信任单一可能自信错误的人工智能的解药。

简而言之

集体人工智能独立查询多个人工智能模型,并让它们相互评分各自的推理。协议是信心信号——但真正的收益是分歧标记了你需要验证的确切位置。共识并不是证明真理的证据。

定义集体人工智能

集体人工智能(CAI)是结合多个人工智能模型独立推理的实践,以达到比任何单一模型提供的更可靠、更好校准的理解。CAI不是向一个模型询问答案,而是向多个模型提出相同的问题,让每个模型构建一个结构化的案例,然后让每个模型评估其他模型的论点。输出不是单一的裁决——而是独立系统一致和分歧的地图。

单一模型的问题:自信地错误

单一人工智能模型没有内置的“我不知道”。它总是生成流畅、自信的输出——即使它在虚构。最常被引用的警示例子是Mata诉Avianca(2023),一名律师提交了一份联邦法院简报,引用了ChatGPT完全虚构的多个司法决定。这些引用看起来真实。模型很自信。循环中没有第二意见来捕捉它。

为什么一个模型不够

  • • 模型以高度自信陈述错误信息——没有可靠的不确定性信号
  • • 单一模型有一组你看不到的训练数据盲点
  • • "你确定吗?"的提示往往更强调重复同样的错误
  • • 虚构的引用和证据看起来可能完全合理(Mata诉Avianca,2023)

多个LLM如何创建共识

核心见解是不同模型的失败方式不同。当几个独立模型推理同一主张时,它们的错误很少重合——因此一个模型的错误往往是其他模型反驳的异常值。这是Andrej Karpathy的开源“LLM委员会”模式背后的理念,多个模型独立回答,然后对彼此的响应进行排名。Argumentree.AI通过结构化论点树和所有可用模型之间的匿名互评扩展了这一模式。

1

一次提出问题

相同的主张或研究问题发送给每个可用模型

2

每个模型独立推理

模型在不查看彼此工作的情况下构建支持和反对的论点

3

论点形成树状结构

推理结构化,以便每个点都可以被检查——而不是混合成一个答案

4

每个模型对每个论点进行评分

匿名互评减少了模型仅仅自我奉承的机会

5

共识和异议都保持可见

你可以看到模型收敛的地方,以及关键的不同之处

共识评分:从多数到一致

共识评分量化模型在给定论点上的一致程度——从微弱多数到完全一致。最重要的设计原则是反平坦化:异议从未被平均化。大多数模型拒绝的少数立场仍然可见,因为一个推理良好的异常值往往正是值得人类更仔细审视的论点。

通过分歧检测幻觉

因为独立模型很少虚构相同的东西,幻觉通常表现为低评分的、有争议的论点,而不是平滑的共识。因此,分歧是一个检测信号:它指向最可能错误的主张。注意认识论——CAI在通过分歧标记问题方面表现出色,并且它并不声称协议证明某个陈述是真实的。

使用案例

集体人工智能适用于任何单一自信答案风险较高的工作流程:研究和文献回顾、事实核查、尽职调查、竞争分析,以及需要了解主张争议程度的高风险决策——不仅仅是一个模型所说的。在每种情况下,最高价值的输出是模型之间分歧的点,人类审查应集中于此。

使用Argumentree.AI的集体人工智能

查询所有可用模型

在一个地方向多个模型提出相同的问题

查看共识评分

了解模型的同意程度——从多数到一致

检查推理

以结构化树的形式阅读每个模型的论点,而不是混合答案

揭示分歧

有争议的点被标记,以便你知道在哪里进行验证

常见问题

什么是集体人工智能?

集体人工智能是让多个人工智能模型独立推理同一问题,构建论点并相互评分,以揭示它们同意的地方——更重要的是——它们不同意的地方的实践。与其信任一个模型的自信答案,不如看到一系列独立的观点,这样幻觉和盲点就会作为分歧浮现,而不是悄然无声。

人工智能模型之间的协议是否证明某事是真实的?

不。协议是信心信号,而不是证据。多个模型可能共享相同的训练数据偏见,并且一起自信地错误。集体人工智能最有价值的是相反的:模型之间的分歧是一个可靠的信号,表明某个主张需要人类验证。高共识降低了审查的优先级;它从未取代审查。

使用多个人工智能模型如何捕捉幻觉?

不同模型的幻觉方式不同——一个虚构的东西,其他模型通常会正确识别。当几个模型独立评估一个主张时,如果一个模型虚构了证据,其他模型通常会对该论点评分较低。由此产生的分歧标记了可能的幻觉,而单一模型工作流程则会将其呈现为自信的事实。

多模型人工智能的想法来自哪里?

查询多个LLM并让它们相互评估的模式已在开源工作中探索,例如Andrej Karpathy的“LLM委员会”,多个模型独立回答,然后对彼此的响应进行排名。关于代理混合的研究探讨了相关的想法。Argumentree.AI在此基础上构建了结构化论点树和匿名跨模型评分。

集体人工智能适合什么?

它非常适合研究问题、事实核查、文献回顾以及任何单一自信答案风险较高的决策。当你需要了解某个主张的争议程度时,它表现出色——而不仅仅是“答案”是什么。使用它来优先考虑人类验证最需要的地方,特别是在模型分歧的点上。

看看多个人工智能模型的真实想法

不要信任一个自信的答案。获取集体人工智能——共识和异议并存。

免费开始