Mixture-of-Agents (MoA) est une architecture multicouche utilisant plusieurs LLM, présentée dans l’article « Mixture-of-Agents Enhances Large Language Model Capabilities » (arXiv:2406.04692). Dans MoA, plusieurs modèles agissent comme des émetteurs de propositions dans une couche ; leurs réponses sont concaténées et transmises à des modèles d’agrégation dans la couche suivante, qui synthétisent une réponse affinée. Des couches supplémentaires répètent ce processus d’affinement. L’article démontre des améliorations sur des ensembles de données de référence axés sur les préférences, tels qu’AlpacaEval 2.0, MT-Bench et FLASK, qui mesurent la qualité des réponses selon l’évaluation d’un évaluateur, sans pour autant garantir l’exactitude factuelle. MoA multiplie également le coût en jetons et augmente la latence, car il effectue de nombreux appels à différents modèles dans les différentes couches, et l’agrégation peut masquer un désaccord réel. Argumentree.AI est similaire mais distinct : au lieu d’agréger les réponses en une seule réponse synthétisée, il conserve les arguments individuels de chaque modèle et fait évaluer les arguments de chaque modèle par tous les autres modèles disponibles, afin de mettre en évidence le consensus et le désaccord plutôt que de les dissimuler.
La méthode Mixture-of-Agents (MoA) considère plusieurs modèles de langage volumineux (LLM) comme des agents collaborant entre eux : les agents « proposeurs » génèrent des réponses potentielles, et les agents « agrégateurs » les synthétisent pour créer une réponse unique et améliorée. Il s’agit d’une technique réelle qui implique de réels compromis, et non d’un simple moyen magique d’améliorer la précision.
Les couches de type Mixture-of-Agents utilisent plusieurs LLM : les modèles « proposer » élaborent des réponses, et les modèles « agrégateur » les combinent. L’article arXiv : 2406.04692 montre une amélioration des performances sur les critères d’évaluation des préférences (AlpacaEval, MT-Bench) – qualité de la réponse, mais pas de vérification de l’exactitude factuelle –, et cela entraîne un coût plus élevé en termes de nombre de jetons et de latence par rapport à l’utilisation d’un seul modèle.
Le concept de « Mixture-of-Agents » a été présenté dans l’article de 2024 intitulé « Mixture-of-Agents Enhances Large Language Model Capabilities » (arXiv:2406.04692). L’observation principale est la suivante : la collaboration : les LLM ont tendance à produire de meilleures réponses lorsqu’ils peuvent consulter et s’appuyer sur les résultats d’autres modèles, même si ces derniers sont individuellement moins performants. MoA transforme cette observation en une architecture.
MoA est organisé en couches. Chaque couche contient plusieurs « agents » LLM. Les modèles d’une couche génèrent chacun une réponse, ces réponses sont concaténées et transmises à la couche suivante, dont les modèles agissent comme des agrégateurs qui affinent et synthétisent les informations. L’empilement de couches répète le processus d’affinement.
Plusieurs modèles répondent chacun indépendamment à l'invite dans la première couche.
Toutes les sorties de la première couche sont rassemblées en tant que matériel de référence pour la couche suivante.
Les modèles de la deuxième couche lisent les propositions et produisent une réponse raffinée et fusionnée.
Des couches supplémentaires continuent d'affiner ; un modèle d'agrégation final émet la réponse.
Demandez : « Notre API doit-elle renvoyer le code 200 ou 202 pour une tâche asynchrone acceptée ? » Trois modèles proposent chacun une réponse en citant les conventions REST. Un agrégateur lit les trois réponses, constate que deux préconisent le code 202 (Accepté) avec une URL d’état et qu’une seule préconise le code 200, puis synthétise une recommandation unique qui intègre les arguments les plus solides de chaque réponse. La réponse combinée est bien formulée, mais si les trois modèles partageaient la même idée fausse, l’agrégateur la répéterait en toute confiance.
L’article présente des résultats probants sur les évaluations de type « préférence » — AlpacaEval 2.0, MT-Bench et FLASK —, où un évaluateur (souvent un LLM ou un humain) attribue une note à la réponse qu’il juge la plus utile ou de meilleure qualité. C’est une distinction importante pour les développeurs :
Trois modèles polyvalents. En tant que développeur, choisissez en fonction de ce dont vous avez besoin pour votre projet : une réponse parfaite ou un raisonnement inter-modèles transparent.
| Motif | Ce qu’il optimise. | Ce que vous obtenez |
|---|---|---|
| Mixture-of-Agents | Une réponse synthétisée et améliorée | Les agrégateurs fusionnent les résultats des différents modèles ; les points de vue individuels disparaissent dans la synthèse |
| LLM council | Contribution transparente par modèle | La réponse de chaque modèle reste visible ; les modèles s'évaluent souvent mutuellement |
| Multi-LLM consensus | Accord + signal de désaccord | Quantifie les points sur lesquels les modèles sont d'accord (confiance) et divergent (la question litigieuse) |
Règle générale : utilisez la méthode « MoA » lorsque vous recherchez la meilleure réponse possible et que vous êtes prêt à accepter le coût en termes de temps de calcul ou de latence ; utilisez une approche basée sur un consensus ou une évaluation collective lorsque le désaccord lui-même est l’objectif.
Argumentree.AI partage le principe de MoA : plusieurs modèles sont plus performants qu’un seul, mais conserve les résultats individuels visibles au lieu de les fusionner.
Chaque modèle répond de manière indépendante — aucun regroupement des propositions/agrégations en une seule voix.
Les arguments individuels pour et contre restent attribuables au modèle qui les a formulés.
Chaque modèle disponible évalue les arguments de tous les autres modèles.
Vous voyez l'accord comme une preuve et le désaccord comme la véritable question.
Le Mixture-of-Agents (MoA) est une architecture à couches dans laquelle plusieurs grands modèles linguistiques agissent comme des « proposeurs » dans une couche, et leurs résultats sont transmis aux modèles d’agrégation de la couche suivante qui synthétisent une réponse affinée. Introduit dans l’article intitulé « Mixture-of-Agents Enhances Large Language Model Capabilities » (arXiv:2406.04692), il considère plusieurs LLM comme des agents collaborant plutôt que de s’appuyer sur un seul modèle.
L’article original sur le MoA indique une amélioration des performances dans les tests de type « préférence », tels qu’AlpacaEval 2.0, MT-Bench et FLASK, où un évaluateur note la qualité de la réponse. Il s’agit de mesures de préférence et d’utilité, et non d’une garantie d’exactitude factuelle. Le MoA peut produire une réponse plus soignée et mieux structurée tout en répétant une erreur factuelle commune, il ne doit donc pas être considéré comme une garantie de vérité.
Le MoA exécute de nombreux modèles sur plusieurs couches, ce qui multiplie le coût des jetons et ajoute une latence par rapport à l’appel d’un seul modèle. Les couches d’agrégation peuvent également atténuer les désaccords réels entre les proposeurs, en masquant les opinions minoritaires qui méritaient réellement d’être prises en compte. Il s’agit d’une technique réelle avec un compromis réel entre coût et latence, et non d’une mise à niveau gratuite.
Le MoA est une architecture de synthèse : les modèles proposeurs alimentent les agrégateurs qui fusionnent tout en une seule réponse affinée. Un conseil de LLM conserve la contribution de chaque modèle et permet souvent aux modèles d’évaluer ou de noter les autres, afin que vous puissiez voir où ils sont en désaccord. Le MoA optimise pour obtenir un résultat unique et cohérent ; un conseil optimise pour la transparence des points de vue individuels.
Pas exactement. Argumentree.AI partage le principe du MoA selon lequel plusieurs modèles sont plus performants qu’un seul, mais au lieu de les agréger en une seule réponse synthétisée, il conserve les arguments individuels de chaque modèle et fait évaluer par chaque modèle disponible les arguments de tous les autres modèles. L’objectif est de mettre en évidence le consensus et le désaccord de manière transparente, plutôt que de masquer les résultats individuels derrière une seule réponse fusionnée.
MoA combine les différents modèles pour fournir une seule réponse. Argumentree.AI permet de conserver tous les arguments de chaque modèle et d’évaluer leur pertinence par des pairs.
Commencer gratuitement