混合代理(MoA)是一种分层的多LLM架构,介绍于论文《混合代理增强大型语言模型能力》(arXiv:2406.04692)。在MoA中,多个模型在一层中作为提议者;它们的响应被连接并传递给下一层的聚合模型,后者合成一个精炼的答案。额外的层重复这种精炼。论文展示了在偏好风格基准(如AlpacaEval 2.0、MT-Bench和FLASK)上的收益——这些是由评估者判断的响应质量的衡量,而不是事实准确性的保证。由于在各层之间运行多个模型调用,MoA还增加了令牌成本和延迟,并且聚合可能会掩盖真正的分歧。Argumentree.AI相关但不同:它不是将所有内容聚合成一个合成答案,而是保留每个模型的个别论点,并让每个可用模型对其他模型的论点进行评分,揭示共识和异议,而不是将其隐藏。
混合代理层叠多个LLM:提议者模型草拟答案,聚合器模型合并它们。arXiv:2406.04692论文显示在偏好基准(AlpacaEval、MT-Bench)上的收益——响应质量,而不是经过验证的事实准确性——并且它的令牌和延迟成本高于单个模型。
混合代理是在2024年论文《混合代理增强大型语言模型能力》(arXiv:2406.04692)中介绍的。核心观察是协作性:当LLM能够看到并基于其他模型的输出进行构建时,它们往往会产生更好的响应——即使是那些单独较弱的模型。MoA将这一观察转化为一种架构。
MoA被组织为多个层。每一层包含几个LLM“代理”。一层的模型各自生成一个响应,这些响应被连接并交给下一层,其模型作为聚合器进行精炼和合成。堆叠层重复这种精炼。
多个模型在第一层中独立回答提示。
所有第一层的输出被收集作为下一层的参考材料。
第二层模型读取候选并生成一个精炼的合并响应。
额外的层继续进行精炼;最终的聚合器发出答案。
询问“我们的API应该为已接受的异步作业返回200还是202?”三个提议者模型各自草拟一个引用REST约定的答案。一个聚合器读取所有三个,注意到两个支持202 Accepted并附带状态URL,而一个支持200,并合成一个包含每个模型最强推理的单一建议。混合的答案读起来很好——但如果所有三个模型共享相同的误解,聚合器将自信地重复它。
论文报告在偏好风格基准(如AlpacaEval 2.0、MT-Bench和FLASK)上取得了强劲的结果——在这些基准中,评审(通常是LLM或人类)评分哪个响应更有帮助或质量更高。这对开发者来说是一个重要的区别:
三种多模型模式。作为开发者,根据您需要交付的内容进行选择:一个精炼的答案,或可见的跨模型推理。
| 模式 | 优化内容 | 您获得的内容 |
|---|---|---|
| 混合代理 | 一个精炼的混合答案 | 聚合器合并提议者输出;个别观点消失在合成中 |
| LLM委员会 | 透明的每模型贡献 | 每个模型的答案保持可见;模型通常相互评估 |
| 多LLM共识 | 一致性+分歧信号 | 量化模型一致(信心)和分歧(争议问题) |
经验法则:当您想要单一最佳答案并能支付令牌/延迟成本时,选择MoA;当分歧本身是产品时,选择委员会或共识评分。
Argumentree.AI共享MoA的前提——多个模型胜过一个——但保留个别输出可见,而不是将其合并。
每个模型独立回答——没有提议者/聚合器合并为一个声音
个别的支持/反对论点归属于提出它们的模型
每个可用模型对其他模型的论点进行评分
您可以看到一致性作为信心,分歧作为真正的问题
混合代理(MoA)是一种分层架构,其中多个大型语言模型在一层中作为提议者,其输出被传递给下一层的聚合模型,后者合成一个精炼的响应。它在论文《混合代理增强大型语言模型能力》(arXiv:2406.04692)中介绍,将多个LLM视为协作代理,而不是依赖单一模型。
原始的MoA论文报告在偏好风格基准(如AlpacaEval 2.0、MT-Bench和FLASK)上取得了收益,评审对响应质量进行评分。这些是偏好和有用性衡量,而不是事实准确性的保证。MoA可以生成更精炼、更结构良好的答案,同时仍然重复共享的事实错误,因此不应被视为真相的保证。
MoA在多个层中运行多个模型,因此与单个模型调用相比,它增加了令牌成本和延迟。聚合层还可能掩盖提议者之间的真正分歧,隐藏那些实际上值得关注的少数观点。这是一种真实的技术,具有真实的成本/延迟权衡,而不是免费的升级。
MoA是一种合成架构:提议者模型将输出提供给聚合器,后者将所有内容合并为一个精炼的答案。LLM委员会保持每个模型的贡献可见,并且通常让模型相互评估或评分,因此您可以看到它们的分歧。MoA优化一个强大的混合输出;而委员会优化个别观点的透明度。
不完全是。Argumentree.AI共享MoA的前提,即多个模型胜过一个,但它不是将所有内容聚合成一个合成答案,而是保留每个模型的个别论点,并让每个可用模型对其他模型的论点进行评分。目标是透明地揭示共识和分歧,而不是将个别输出隐藏在一个合并的响应后面。