Qu'est-ce que le modèle « mélange d'agents » ?

Mixture-of-Agents (MoA) est une architecture multicouche utilisant plusieurs LLM, présentée dans l’article « Mixture-of-Agents Enhances Large Language Model Capabilities » (arXiv:2406.04692). Dans MoA, plusieurs modèles agissent comme des émetteurs de propositions dans une couche ; leurs réponses sont concaténées et transmises à des modèles d’agrégation dans la couche suivante, qui synthétisent une réponse affinée. Des couches supplémentaires répètent ce processus d’affinement. L’article démontre des améliorations sur des ensembles de données de référence axés sur les préférences, tels qu’AlpacaEval 2.0, MT-Bench et FLASK, qui mesurent la qualité des réponses selon l’évaluation d’un évaluateur, sans pour autant garantir l’exactitude factuelle. MoA multiplie également le coût en jetons et augmente la latence, car il effectue de nombreux appels à différents modèles dans les différentes couches, et l’agrégation peut masquer un désaccord réel. Argumentree.AI est similaire mais distinct : au lieu d’agréger les réponses en une seule réponse synthétisée, il conserve les arguments individuels de chaque modèle et fait évaluer les arguments de chaque modèle par tous les autres modèles disponibles, afin de mettre en évidence le consensus et le désaccord plutôt que de les dissimuler.

Retour à l’intelligence artificielle collective.Architecture multi-modèles de langage étendu

Qu'est-ce que
Mélange d’agents ?

La méthode Mixture-of-Agents (MoA) considère plusieurs modèles de langage volumineux (LLM) comme des agents collaborant entre eux : les agents « proposeurs » génèrent des réponses potentielles, et les agents « agrégateurs » les synthétisent pour créer une réponse unique et améliorée. Il s’agit d’une technique réelle qui implique de réels compromis, et non d’un simple moyen magique d’améliorer la précision.

En résumé ; bref ; pour faire court ; en un mot ; l’essentiel ; ce qu’il faut retenir ; le plus important.

Les couches de type Mixture-of-Agents utilisent plusieurs LLM : les modèles « proposer » élaborent des réponses, et les modèles « agrégateur » les combinent. L’article arXiv : 2406.04692 montre une amélioration des performances sur les critères d’évaluation des préférences (AlpacaEval, MT-Bench) – qualité de la réponse, mais pas de vérification de l’exactitude factuelle –, et cela entraîne un coût plus élevé en termes de nombre de jetons et de latence par rapport à l’utilisation d’un seul modèle.

D’où provient le mode d’action ?

Le concept de « Mixture-of-Agents » a été présenté dans l’article de 2024 intitulé « Mixture-of-Agents Enhances Large Language Model Capabilities » (arXiv:2406.04692). L’observation principale est la suivante : la collaboration : les LLM ont tendance à produire de meilleures réponses lorsqu’ils peuvent consulter et s’appuyer sur les résultats d’autres modèles, même si ces derniers sont individuellement moins performants. MoA transforme cette observation en une architecture.

L’architecture en couches

MoA est organisé en couches. Chaque couche contient plusieurs « agents » LLM. Les modèles d’une couche génèrent chacun une réponse, ces réponses sont concaténées et transmises à la couche suivante, dont les modèles agissent comme des agrégateurs qui affinent et synthétisent les informations. L’empilement de couches répète le processus d’affinement.

1

Les modèles génèrent des propositions

Plusieurs modèles répondent chacun indépendamment à l'invite dans la première couche.

2

Les réponses sont concaténées

Toutes les sorties de la première couche sont rassemblées en tant que matériel de référence pour la couche suivante.

3

Les modèles d'agrégation synthétisent

Les modèles de la deuxième couche lisent les propositions et produisent une réponse raffinée et fusionnée.

4

Facultativement, répéter par couche

Des couches supplémentaires continuent d'affiner ; un modèle d'agrégation final émet la réponse.

Exemple à titre indicatif – il ne s’agit pas d’un résultat réel du modèle.

Demandez : « Notre API doit-elle renvoyer le code 200 ou 202 pour une tâche asynchrone acceptée ? » Trois modèles proposent chacun une réponse en citant les conventions REST. Un agrégateur lit les trois réponses, constate que deux préconisent le code 202 (Accepté) avec une URL d’état et qu’une seule préconise le code 200, puis synthétise une recommandation unique qui intègre les arguments les plus solides de chaque réponse. La réponse combinée est bien formulée, mais si les trois modèles partageaient la même idée fausse, l’agrégateur la répéterait en toute confiance.

Ce que les tests de performance révèlent réellement.

L’article présente des résultats probants sur les évaluations de type « préférence » — AlpacaEval 2.0, MT-Bench et FLASK —, où un évaluateur (souvent un LLM ou un humain) attribue une note à la réponse qu’il juge la plus utile ou de meilleure qualité. C’est une distinction importante pour les développeurs :

Lisez attentivement la réclamation.

  • • La mesure des gains en termes de préférences/taux de succès évalue la qualité perçue, et non une vérité vérifiée.
  • • Une réponse plus fluide et mieux organisée peut toujours contenir des erreurs factuelles.
  • • Si les personnes qui proposent partagent un biais commun, l'agrégation ne fera que le renforcer au lieu de le corriger.
  • • Chaque couche ajoute des appels de modèle : davantage de jetons, coût plus élevé, latence accrue.
  • • L’agrégation peut atténuer un désaccord réel et créer une fausse impression de consensus.

MoA contre le Conseil des LLM contre le consensus multi-LLM

Trois modèles polyvalents. En tant que développeur, choisissez en fonction de ce dont vous avez besoin pour votre projet : une réponse parfaite ou un raisonnement inter-modèles transparent.

MotifCe qu’il optimise.Ce que vous obtenez
Mixture-of-AgentsUne réponse synthétisée et amélioréeLes agrégateurs fusionnent les résultats des différents modèles ; les points de vue individuels disparaissent dans la synthèse
LLM councilContribution transparente par modèleLa réponse de chaque modèle reste visible ; les modèles s'évaluent souvent mutuellement
Multi-LLM consensusAccord + signal de désaccordQuantifie les points sur lesquels les modèles sont d'accord (confiance) et divergent (la question litigieuse)

Règle générale : utilisez la méthode « MoA » lorsque vous recherchez la meilleure réponse possible et que vous êtes prêt à accepter le coût en termes de temps de calcul ou de latence ; utilisez une approche basée sur un consensus ou une évaluation collective lorsque le désaccord lui-même est l’objectif.

Quelle est la place d’Argumentree.AI ?

Argumentree.AI partage le principe de MoA : plusieurs modèles sont plus performants qu’un seul, mais conserve les résultats individuels visibles au lieu de les fusionner.

Interroger tous les modèles disponibles

Chaque modèle répond de manière indépendante — aucun regroupement des propositions/agrégations en une seule voix.

Conserver chaque argument

Les arguments individuels pour et contre restent attribuables au modèle qui les a formulés.

Évaluation croisée des modèles

Chaque modèle disponible évalue les arguments de tous les autres modèles.

Mettre en évidence le consensus et la dissidence

Vous voyez l'accord comme une preuve et le désaccord comme la véritable question.

Foire aux questions

Qu'est-ce que le Mixture-of-Agents (MoA) ?

Le Mixture-of-Agents (MoA) est une architecture à couches dans laquelle plusieurs grands modèles linguistiques agissent comme des « proposeurs » dans une couche, et leurs résultats sont transmis aux modèles d’agrégation de la couche suivante qui synthétisent une réponse affinée. Introduit dans l’article intitulé « Mixture-of-Agents Enhances Large Language Model Capabilities » (arXiv:2406.04692), il considère plusieurs LLM comme des agents collaborant plutôt que de s’appuyer sur un seul modèle.

Le Mixture-of-Agents permet-il d’obtenir des réponses plus précises ?

L’article original sur le MoA indique une amélioration des performances dans les tests de type « préférence », tels qu’AlpacaEval 2.0, MT-Bench et FLASK, où un évaluateur note la qualité de la réponse. Il s’agit de mesures de préférence et d’utilité, et non d’une garantie d’exactitude factuelle. Le MoA peut produire une réponse plus soignée et mieux structurée tout en répétant une erreur factuelle commune, il ne doit donc pas être considéré comme une garantie de vérité.

Quels sont les inconvénients du Mixture-of-Agents ?

Le MoA exécute de nombreux modèles sur plusieurs couches, ce qui multiplie le coût des jetons et ajoute une latence par rapport à l’appel d’un seul modèle. Les couches d’agrégation peuvent également atténuer les désaccords réels entre les proposeurs, en masquant les opinions minoritaires qui méritaient réellement d’être prises en compte. Il s’agit d’une technique réelle avec un compromis réel entre coût et latence, et non d’une mise à niveau gratuite.

En quoi le MoA diffère-t-il d’un conseil de LLM ?

Le MoA est une architecture de synthèse : les modèles proposeurs alimentent les agrégateurs qui fusionnent tout en une seule réponse affinée. Un conseil de LLM conserve la contribution de chaque modèle et permet souvent aux modèles d’évaluer ou de noter les autres, afin que vous puissiez voir où ils sont en désaccord. Le MoA optimise pour obtenir un résultat unique et cohérent ; un conseil optimise pour la transparence des points de vue individuels.

Argumentree.AI est-il un système Mixture-of-Agents ?

Pas exactement. Argumentree.AI partage le principe du MoA selon lequel plusieurs modèles sont plus performants qu’un seul, mais au lieu de les agréger en une seule réponse synthétisée, il conserve les arguments individuels de chaque modèle et fait évaluer par chaque modèle disponible les arguments de tous les autres modèles. L’objectif est de mettre en évidence le consensus et le désaccord de manière transparente, plutôt que de masquer les résultats individuels derrière une seule réponse fusionnée.

Observez plusieurs modèles raisonner – sans les fusionner.

MoA combine les différents modèles pour fournir une seule réponse. Argumentree.AI permet de conserver tous les arguments de chaque modèle et d’évaluer leur pertinence par des pairs.

Commencer gratuitement