什么是混合代理?

混合代理(MoA)是一种分层的多LLM架构,介绍于论文《混合代理增强大型语言模型能力》(arXiv:2406.04692)。在MoA中,多个模型在一层中作为提议者;它们的响应被连接并传递给下一层的聚合模型,后者合成一个精炼的答案。额外的层重复这种精炼。论文展示了在偏好风格基准(如AlpacaEval 2.0、MT-Bench和FLASK)上的收益——这些是由评估者判断的响应质量的衡量,而不是事实准确性的保证。由于在各层之间运行多个模型调用,MoA还增加了令牌成本和延迟,并且聚合可能会掩盖真正的分歧。Argumentree.AI相关但不同:它不是将所有内容聚合成一个合成答案,而是保留每个模型的个别论点,并让每个可用模型对其他模型的论点进行评分,揭示共识和异议,而不是将其隐藏。

返回集体AI智能多LLM架构

什么是
混合代理?

混合代理(MoA)将多个LLM视为协作代理——提议者生成候选响应,聚合器将其合成一个精炼的答案。这是一种真实的技术,具有真实的权衡,而不是魔法准确性开关。

TL;DR

混合代理层叠多个LLM:提议者模型草拟答案,聚合器模型合并它们。arXiv:2406.04692论文显示在偏好基准(AlpacaEval、MT-Bench)上的收益——响应质量,而不是经过验证的事实准确性——并且它的令牌和延迟成本高于单个模型。

MoA的来源

混合代理是在2024年论文《混合代理增强大型语言模型能力》(arXiv:2406.04692)中介绍的。核心观察是协作性:当LLM能够看到并基于其他模型的输出进行构建时,它们往往会产生更好的响应——即使是那些单独较弱的模型。MoA将这一观察转化为一种架构。

分层架构

MoA被组织为多个层。每一层包含几个LLM“代理”。一层的模型各自生成一个响应,这些响应被连接并交给下一层,其模型作为聚合器进行精炼和合成。堆叠层重复这种精炼。

1

提议者生成候选

多个模型在第一层中独立回答提示。

2

响应被连接

所有第一层的输出被收集作为下一层的参考材料。

3

聚合器进行合成

第二层模型读取候选并生成一个精炼的合并响应。

4

可选地,按层重复

额外的层继续进行精炼;最终的聚合器发出答案。

说明性示例——非实际模型输出

询问“我们的API应该为已接受的异步作业返回200还是202?”三个提议者模型各自草拟一个引用REST约定的答案。一个聚合器读取所有三个,注意到两个支持202 Accepted并附带状态URL,而一个支持200,并合成一个包含每个模型最强推理的单一建议。混合的答案读起来很好——但如果所有三个模型共享相同的误解,聚合器将自信地重复它。

基准实际显示了什么

论文报告在偏好风格基准(如AlpacaEval 2.0、MT-Bench和FLASK)上取得了强劲的结果——在这些基准中,评审(通常是LLM或人类)评分哪个响应更有帮助或质量更高。这对开发者来说是一个重要的区别:

诚实地阅读声明

  • • 偏好/胜率收益衡量感知质量,而非验证的真相
  • • 更流畅、更有条理的答案仍然可能是事实错误
  • • 如果提议者共享盲点,聚合会强化而不是修复它
  • • 每一层增加模型调用:更多令牌,更高成本,更多延迟
  • • 聚合可能会将真正的分歧压平为虚假的信心

MoA与LLM委员会与多LLM共识

三种多模型模式。作为开发者,根据您需要交付的内容进行选择:一个精炼的答案,或可见的跨模型推理。

模式优化内容您获得的内容
混合代理一个精炼的混合答案聚合器合并提议者输出;个别观点消失在合成中
LLM委员会透明的每模型贡献每个模型的答案保持可见;模型通常相互评估
多LLM共识一致性+分歧信号量化模型一致(信心)和分歧(争议问题)

经验法则:当您想要单一最佳答案并能支付令牌/延迟成本时,选择MoA;当分歧本身是产品时,选择委员会或共识评分。

Argumentree.AI的适用位置

Argumentree.AI共享MoA的前提——多个模型胜过一个——但保留个别输出可见,而不是将其合并。

查询所有可用模型

每个模型独立回答——没有提议者/聚合器合并为一个声音

保留每个论点

个别的支持/反对论点归属于提出它们的模型

跨模型同行评分

每个可用模型对其他模型的论点进行评分

揭示共识和异议

您可以看到一致性作为信心,分歧作为真正的问题

常见问题

什么是混合代理(MoA)?

混合代理(MoA)是一种分层架构,其中多个大型语言模型在一层中作为提议者,其输出被传递给下一层的聚合模型,后者合成一个精炼的响应。它在论文《混合代理增强大型语言模型能力》(arXiv:2406.04692)中介绍,将多个LLM视为协作代理,而不是依赖单一模型。

混合代理是否使答案更准确?

原始的MoA论文报告在偏好风格基准(如AlpacaEval 2.0、MT-Bench和FLASK)上取得了收益,评审对响应质量进行评分。这些是偏好和有用性衡量,而不是事实准确性的保证。MoA可以生成更精炼、更结构良好的答案,同时仍然重复共享的事实错误,因此不应被视为真相的保证。

混合代理的缺点是什么?

MoA在多个层中运行多个模型,因此与单个模型调用相比,它增加了令牌成本和延迟。聚合层还可能掩盖提议者之间的真正分歧,隐藏那些实际上值得关注的少数观点。这是一种真实的技术,具有真实的成本/延迟权衡,而不是免费的升级。

MoA与LLM委员会有什么不同?

MoA是一种合成架构:提议者模型将输出提供给聚合器,后者将所有内容合并为一个精炼的答案。LLM委员会保持每个模型的贡献可见,并且通常让模型相互评估或评分,因此您可以看到它们的分歧。MoA优化一个强大的混合输出;而委员会优化个别观点的透明度。

Argumentree.AI是混合代理系统吗?

不完全是。Argumentree.AI共享MoA的前提,即多个模型胜过一个,但它不是将所有内容聚合成一个合成答案,而是保留每个模型的个别论点,并让每个可用模型对其他模型的论点进行评分。目标是透明地揭示共识和分歧,而不是将个别输出隐藏在一个合并的响应后面。

查看多个模型推理——而不将其合并

MoA将模型混合为一个答案。Argumentree.AI保持每个模型的论点可见并进行同行评分。

免费开始