エージェントの混合(MoA)は、論文「エージェントの混合は大規模言語モデルの能力を強化する」(arXiv:2406.04692)で紹介されたレイヤー化されたマルチLLMアーキテクチャです。MoAでは、いくつかのモデルが1つのレイヤーで提案者として機能し、それらの応答は連結されて次のレイヤーの集約者モデルに渡され、洗練された回答が合成されます。追加のレイヤーが洗練を繰り返します。この論文は、評価者によって判断される応答の質の指標であるAlpacaEval 2.0、MT-Bench、FLASKなどの好みスタイルのベンチマークでの向上を示していますが、事実の正確性を保証するものではありません。MoAは、レイヤー間で多くのモデル呼び出しを実行するため、トークンコストを増加させ、レイテンシを追加します。また、集約は本物の意見の不一致を滑らかにすることがあります。Argumentree.AIは関連していますが、異なります:1つの合成された回答に集約するのではなく、各モデルの個々の主張を保持し、利用可能なすべてのモデルが他のモデルの主張を評価し、合意と異議を浮き彫りにします。
エージェントの混合(MoA)は、複数のLLMを協力するエージェントとして扱います — 提案者が候補応答を生成し、集約者がそれらを1つの洗練された回答に合成します。これは実際の技術であり、実際のトレードオフがあります、魔法のような精度のスイッチではありません。
エージェントの混合は複数のLLMをレイヤー化します:提案者モデルが回答を草案し、集約者モデルがそれらを統合します。arXiv:2406.04692の論文は、好みのベンチマーク(AlpacaEval、MT-Bench)での向上を示しています — 応答の質、事実の正確性の証明ではなく — そして、1つのモデルよりも多くのトークンとレイテンシがかかります。
エージェントの混合は、2024年の論文「エージェントの混合は大規模言語モデルの能力を強化する」(arXiv:2406.04692)で紹介されました。核心的な観察は協力性です:LLMは他のモデルの出力を見てそれに基づいて構築できるとき、より良い応答を生成する傾向があります — 個々のモデルが弱い場合でも。MoAはその観察をアーキテクチャに変換します。
MoAはレイヤーに整理されています。各レイヤーにはいくつかのLLM「エージェント」が含まれています。レイヤーのモデルはそれぞれ応答を生成し、それらの応答は連結されて次のレイヤーに渡され、そのモデルは集約者として洗練し合成します。レイヤーを重ねることで洗練が繰り返されます。
複数のモデルがそれぞれ独立してプロンプトに応答します(レイヤー1)。
すべてのレイヤー1の出力が次のレイヤーの参考資料として集められます。
レイヤー2のモデルが候補を読み取り、洗練された統合応答を生成します。
追加のレイヤーが洗練を続け、最終的な集約者が回答を出します。
「非同期ジョブが受け入れられた場合、APIは200または202を返すべきですか?」と尋ねます。3つの提案者モデルがそれぞれRESTの慣習を引用して回答を草案します。集約者は3つすべてを読み取り、2つがステータスURL付きの202 Acceptedを支持し、1つが200を支持していることに気づき、各モデルからの最も強い理由を折り込んだ単一の推奨を合成します。ブレンドされた回答は良く読まれます — しかし、もし3つすべてが同じ誤解を共有していた場合、集約者はそれを自信を持って繰り返すことになります。
この論文は好みスタイルのベンチマーク — AlpacaEval 2.0、MT-Bench、FLASK — での強力な結果を報告しています。ここでは、審査員(しばしばLLMまたは人間)がどの応答がより役立つか、または質が高いかを評価します。これは開発者にとって重要な区別です:
3つのマルチモデルパターン。開発者として、出荷する必要があるものによって選択します:1つの洗練された回答、または可視的なクロスモデルの推論。
| パターン | 最適化するもの | 得られるもの |
|---|---|---|
| エージェントの混合 | 1つの洗練されたブレンドされた回答 | 集約者が提案者の出力を統合します;個々の見解は合成の中に消えます |
| LLM評議会 | モデルごとの透明な貢献 | 各モデルの回答が可視化されます;モデルはしばしば互いに評価します |
| マルチLLM合意 | 合意 + 不一致の信号 | モデルが合意する場所(自信)と分岐する場所(争点)を定量化します |
経験則:トークン/レイテンシコストを支払うことができる場合は、単一の最良の回答を求めるときにMoAを選択し、意見の不一致自体が製品である場合は評議会または合意スコアリングを選択します。
Argumentree.AIはMoAの前提を共有しています — 複数のモデルが1つに勝る — しかし、個々の出力を可視化したままにし、統合しません。
各モデルが独立して回答します — 提案者/集約者が1つの声に統合されることはありません
個々の賛成/反対の主張は、それを行ったモデルに帰属します
すべての利用可能なモデルが他のモデルの主張を評価します
合意を自信として、異議を本当の質問として見ることができます
エージェントの混合(MoA)は、複数の大規模言語モデルが1つのレイヤーで提案者として機能し、その出力が次のレイヤーの集約者モデルに渡され、洗練された応答が合成されるレイヤー化されたアーキテクチャです。論文「エージェントの混合は大規模言語モデルの能力を強化する」(arXiv:2406.04692)で紹介され、複数のLLMを単一のモデルに依存するのではなく、協力するエージェントとして扱います。
元のMoA論文は、AlpacaEval 2.0、MT-Bench、FLASKなどの好みスタイルのベンチマークでの向上を報告しています。ここでは、審査員が応答の質を評価します。これらは好みと有用性の指標であり、事実の正確性を保証するものではありません。MoAは、より洗練された、より構造化された回答を生成することができますが、共有された事実の誤りを繰り返す可能性があるため、真実の保証として扱うべきではありません。
MoAは複数のレイヤーにわたって多くのモデルを実行するため、単一のモデル呼び出しと比較してトークンコストを増加させ、レイテンシを追加します。集約者レイヤーは、提案者間の本物の意見の不一致を滑らかにし、実際に見る価値のある少数派の見解を隠すことがあります。これは実際の技術であり、実際のコスト/レイテンシのトレードオフがあるもので、無料のアップグレードではありません。
MoAは合成アーキテクチャです:提案者モデルが集約者にフィードし、すべてを1つの洗練された回答に統合します。LLM評議会は各モデルの貢献を可視化し、モデルが互いに評価または評価することが多いため、どこで意見が異なるかを見ることができます。MoAは1つの強力なブレンドされた出力を最適化し、評議会は個々の視点の透明性を最適化します。
正確にはそうではありません。Argumentree.AIは、複数のモデルが1つに勝るというMoAの前提を共有していますが、単一の合成された回答に集約するのではなく、各モデルの個々の主張を保持し、利用可能なすべてのモデルが他のモデルの主張を評価します。目標は、合意と異議を透明に浮き彫りにすることであり、1つの統合された応答の背後に個々の出力を隠すことではありません。