什么是 LLM 委员会?

LLM 委员会是一个大型语言模型的组,每个模型独立回答一个问题,然后相互评分以达成共识。这个模式由 Andrej Karpathy 的开源 'llm-council' 仓库推广,这是一个概念证明,其中几个模型回答并在最终综合之前相互排名。Argumentree.AI 通过结构化的论证树和匿名的相互评分扩展了这一委员会模式——匿名是因为关于使用 LLM 作为评判者的研究记录了自我增强偏见,模型倾向于偏爱自己的输出。托管的 LLM 委员会让您可以查询多个模型,而无需提供自己的 API 密钥。诚实的权衡是成本和延迟:委员会进行多个模型调用,因此比单个查询更慢且更昂贵,以换取跨模型验证和明显的分歧。

返回集体 AI 智能多 AI 研究

什么是
LLM 委员会?

一个 LLM 委员会 有几个语言模型独立回答,相互评分并达成共识。它将 "一个自信的答案" 转变为您可以检查的审议。

TL;DR

一个 LLM 委员会 是多个模型独立回答,然后相互评分以形成共识。这个模式来自 Karpathy 的开源 llm-council。Argumentree.AI 托管它——无需 API 密钥——并匿名评分以抑制自我夸耀。

委员会模式

这个 委员会模式 的表述很简单:多个 LLM 独立回答同一个问题,然后评估彼此的答案,并从同行评分中得出共识。没有单一模型拥有最后的发言权。因为模型在回答之前看不到彼此的响应,所以它们的独立推理得以保留——而它们分歧的地方变得可见,而不是隐藏在一个自信的回复后面。

1

独立回答

每个模型独立回答问题,而不查看其他模型的回答

2

同行评分

每个模型评估其他模型的答案

3

共识

评分被汇总以揭示委员会的同意和不同意见

开源概念证明

Andrej Karpathy 发布了一个开源的 "llm-council" 仓库,演示了这个流程——几个模型回答,互相排名,然后综合出最终响应。这是一个公开的证明,表明模型可以有意义地相互评估。Argumentree.AI 在同一理念上进行扩展。

多 LLM 委员会:Argumentree.AI 如何扩展它

Argumentree.AI 在两个方面进一步发展了委员会模式。首先,它不是比较完整的答案,而是将每个模型的推理结构化为 论证树——这样可以对单个主张进行评分和检查,而不仅仅是最终段落。其次,它使用 匿名相互评分:当一个模型评分时,它不知道哪个模型提出了这些论点。

为什么要进行匿名评分?

关于使用 LLM 作为评判者的研究记录了 自我增强偏见——模型倾向于更有利地评分自己的输出。在评分之前隐藏作者身份消除了这种捷径,因此模型不能简单地奖励自己。这是 Argumentree.AI 的匿名交叉评分设计理念。

托管的 LLM 委员会,无需 API 密钥

自己运行一个委员会通常意味着要与每个模型提供者注册并连接单独的 API 密钥。Argumentree.AI 提供一个 托管的 LLM 委员会:您只需询问一次,所有可用模型都参与——无需管理密钥,无需每个提供者的设置。您可以在一个地方获得委员会的共识和分歧。

诚实的权衡:成本和延迟

委员会不是免费的。根据定义,它进行 多个模型调用,因此使用更多计算资源并且返回时间比单个查询更长。这是一个故意的权衡:您花费更多以获得跨模型验证和明显的分歧图。对于高风险研究来说,这是一个不错的交易;对于琐碎的查找,一个模型就足够了。

使用 Argumentree.AI 运行 LLM 委员会

所有可用模型

通过一个问题召集多个模型的委员会

结构化论证树

逐点检查每个模型的推理,而不是作为一个整体

匿名评分

交叉评分隐藏作者身份以抑制自我增强偏见

托管,无需密钥

无需每个提供者的 API 密钥——开箱即用的共识和异议

常见问题

什么是 LLM 委员会?

LLM 委员会是一个大型语言模型的组,每个模型独立回答一个问题,然后相互评分以产生共识观点。委员会使模型之间的同意和不同意见变得明确——因此您可以看到模型在哪里趋同,在哪里不同。

LLM 委员会的想法来自哪里?

Andrej Karpathy 发布了一个开源的 'llm-council' 仓库,演示了这一模式:几个模型回答一个查询,然后在最终综合之前相互排名。这是跨模型集体推理的概念证明。Argumentree.AI 通过结构化论证树和匿名相互评分扩展了这一理念。

为什么模型应该匿名评分?

关于使用 LLM 作为评判者的研究记录了自我增强偏见——模型倾向于偏爱自己的输出。在评分之前匿名化哪个模型产生了哪个论点可以减少这种偏见,因此模型不能简单地奖励自己。这是 Argumentree.AI 的匿名交叉评分背后的设计理念。

我需要自己的 API 密钥来运行 LLM 委员会吗?

使用托管的 LLM 委员会不需要。开源实现通常要求您为每个提供者提供 API 密钥。Argumentree.AI 提供一个托管的多 LLM 委员会,因此您可以查询多个模型并查看它们的共识,而无需自己连接单独的 API 密钥。

LLM 委员会的缺点是什么?

老实说,运行一个委员会的成本高于单个查询——它进行多个模型调用,因此使用更多计算资源并且返回时间更长。这种权衡为您提供了跨模型验证和明显的分歧图。对于高风险问题,额外的成本和延迟通常是值得的;对于琐碎的查找,一个模型就足够了。

召集您自己的 LLM 委员会

多个模型,一个问题,您可以检查的共识——无需 API 密钥。

免费开始