エージェントの混合とは?

エージェントの混合(MoA)は、論文「エージェントの混合は大規模言語モデルの能力を強化する」(arXiv:2406.04692)で紹介されたレイヤー化されたマルチLLMアーキテクチャです。MoAでは、いくつかのモデルが1つのレイヤーで提案者として機能し、それらの応答は連結されて次のレイヤーの集約者モデルに渡され、洗練された回答が合成されます。追加のレイヤーが洗練を繰り返します。この論文は、評価者によって判断される応答の質の指標であるAlpacaEval 2.0、MT-Bench、FLASKなどの好みスタイルのベンチマークでの向上を示していますが、事実の正確性を保証するものではありません。MoAは、レイヤー間で多くのモデル呼び出しを実行するため、トークンコストを増加させ、レイテンシを追加します。また、集約は本物の意見の不一致を滑らかにすることがあります。Argumentree.AIは関連していますが、異なります:1つの合成された回答に集約するのではなく、各モデルの個々の主張を保持し、利用可能なすべてのモデルが他のモデルの主張を評価し、合意と異議を浮き彫りにします。

コレクティブAIインテリジェンスに戻るマルチLLMアーキテクチャ

エージェントの混合とは
何ですか?

エージェントの混合(MoA)は、複数のLLMを協力するエージェントとして扱います — 提案者が候補応答を生成し、集約者がそれらを1つの洗練された回答に合成します。これは実際の技術であり、実際のトレードオフがあります、魔法のような精度のスイッチではありません。

要約

エージェントの混合は複数のLLMをレイヤー化します:提案者モデルが回答を草案し、集約者モデルがそれらを統合します。arXiv:2406.04692の論文は、好みのベンチマーク(AlpacaEval、MT-Bench)での向上を示しています — 応答の質、事実の正確性の証明ではなく — そして、1つのモデルよりも多くのトークンとレイテンシがかかります。

MoAの起源

エージェントの混合は、2024年の論文「エージェントの混合は大規模言語モデルの能力を強化する」(arXiv:2406.04692)で紹介されました。核心的な観察は協力性です:LLMは他のモデルの出力を見てそれに基づいて構築できるとき、より良い応答を生成する傾向があります — 個々のモデルが弱い場合でも。MoAはその観察をアーキテクチャに変換します。

レイヤー化されたアーキテクチャ

MoAはレイヤーに整理されています。各レイヤーにはいくつかのLLM「エージェント」が含まれています。レイヤーのモデルはそれぞれ応答を生成し、それらの応答は連結されて次のレイヤーに渡され、そのモデルは集約者として洗練し合成します。レイヤーを重ねることで洗練が繰り返されます。

1

提案者が候補を生成

複数のモデルがそれぞれ独立してプロンプトに応答します(レイヤー1)。

2

応答が連結される

すべてのレイヤー1の出力が次のレイヤーの参考資料として集められます。

3

集約者が合成

レイヤー2のモデルが候補を読み取り、洗練された統合応答を生成します。

4

オプションで、レイヤーごとに繰り返す

追加のレイヤーが洗練を続け、最終的な集約者が回答を出します。

例示的な例 — 実際のモデル出力ではありません

「非同期ジョブが受け入れられた場合、APIは200または202を返すべきですか?」と尋ねます。3つの提案者モデルがそれぞれRESTの慣習を引用して回答を草案します。集約者は3つすべてを読み取り、2つがステータスURL付きの202 Acceptedを支持し、1つが200を支持していることに気づき、各モデルからの最も強い理由を折り込んだ単一の推奨を合成します。ブレンドされた回答は良く読まれます — しかし、もし3つすべてが同じ誤解を共有していた場合、集約者はそれを自信を持って繰り返すことになります。

ベンチマークが実際に示すもの

この論文は好みスタイルのベンチマーク — AlpacaEval 2.0、MT-Bench、FLASK — での強力な結果を報告しています。ここでは、審査員(しばしばLLMまたは人間)がどの応答がより役立つか、または質が高いかを評価します。これは開発者にとって重要な区別です:

主張を正直に読む

  • • 好み/勝率の向上は、確認された真実ではなく、認識された質を測定します
  • • より流暢で、より整理された回答でも、事実的に間違っている可能性があります
  • • 提案者が盲点を共有している場合、集約はそれを修正するのではなく強化します
  • • 各レイヤーはモデル呼び出しを追加します:より多くのトークン、より高いコスト、より多くのレイテンシ
  • • 集約は本物の意見の不一致を偽の自信に平坦化することがあります

MoA vs LLM評議会 vs マルチLLM合意

3つのマルチモデルパターン。開発者として、出荷する必要があるものによって選択します:1つの洗練された回答、または可視的なクロスモデルの推論。

パターン最適化するもの得られるもの
エージェントの混合1つの洗練されたブレンドされた回答集約者が提案者の出力を統合します;個々の見解は合成の中に消えます
LLM評議会モデルごとの透明な貢献各モデルの回答が可視化されます;モデルはしばしば互いに評価します
マルチLLM合意合意 + 不一致の信号モデルが合意する場所(自信)と分岐する場所(争点)を定量化します

経験則:トークン/レイテンシコストを支払うことができる場合は、単一の最良の回答を求めるときにMoAを選択し、意見の不一致自体が製品である場合は評議会または合意スコアリングを選択します。

Argumentree.AIの位置付け

Argumentree.AIはMoAの前提を共有しています — 複数のモデルが1つに勝る — しかし、個々の出力を可視化したままにし、統合しません。

すべての利用可能なモデルにクエリ

各モデルが独立して回答します — 提案者/集約者が1つの声に統合されることはありません

すべての主張を保持

個々の賛成/反対の主張は、それを行ったモデルに帰属します

クロスモデルのピア評価

すべての利用可能なモデルが他のモデルの主張を評価します

合意と異議を浮き彫りにする

合意を自信として、異議を本当の質問として見ることができます

よくある質問

エージェントの混合(MoA)とは何ですか?

エージェントの混合(MoA)は、複数の大規模言語モデルが1つのレイヤーで提案者として機能し、その出力が次のレイヤーの集約者モデルに渡され、洗練された応答が合成されるレイヤー化されたアーキテクチャです。論文「エージェントの混合は大規模言語モデルの能力を強化する」(arXiv:2406.04692)で紹介され、複数のLLMを単一のモデルに依存するのではなく、協力するエージェントとして扱います。

エージェントの混合は回答をより正確にしますか?

元のMoA論文は、AlpacaEval 2.0、MT-Bench、FLASKなどの好みスタイルのベンチマークでの向上を報告しています。ここでは、審査員が応答の質を評価します。これらは好みと有用性の指標であり、事実の正確性を保証するものではありません。MoAは、より洗練された、より構造化された回答を生成することができますが、共有された事実の誤りを繰り返す可能性があるため、真実の保証として扱うべきではありません。

エージェントの混合の欠点は何ですか?

MoAは複数のレイヤーにわたって多くのモデルを実行するため、単一のモデル呼び出しと比較してトークンコストを増加させ、レイテンシを追加します。集約者レイヤーは、提案者間の本物の意見の不一致を滑らかにし、実際に見る価値のある少数派の見解を隠すことがあります。これは実際の技術であり、実際のコスト/レイテンシのトレードオフがあるもので、無料のアップグレードではありません。

MoAはLLM評議会とどのように異なりますか?

MoAは合成アーキテクチャです:提案者モデルが集約者にフィードし、すべてを1つの洗練された回答に統合します。LLM評議会は各モデルの貢献を可視化し、モデルが互いに評価または評価することが多いため、どこで意見が異なるかを見ることができます。MoAは1つの強力なブレンドされた出力を最適化し、評議会は個々の視点の透明性を最適化します。

Argumentree.AIはエージェントの混合システムですか?

正確にはそうではありません。Argumentree.AIは、複数のモデルが1つに勝るというMoAの前提を共有していますが、単一の合成された回答に集約するのではなく、各モデルの個々の主張を保持し、利用可能なすべてのモデルが他のモデルの主張を評価します。目標は、合意と異議を透明に浮き彫りにすることであり、1つの統合された応答の背後に個々の出力を隠すことではありません。

複数のモデルが推論するのを見てください — 統合せずに

MoAはモデルを1つの回答にブレンドします。Argumentree.AIは各モデルの主張を可視化し、ピア評価を行います。

無料で始める