Что такое Mixture-of-Agents?

Mixture-of-Agents (MoA) — это многослойная архитектура multi-LLM, представленная в статье "Mixture-of-Agents Enhances Large Language Model Capabilities" (arXiv:2406.04692). В MoA несколько моделей действуют как предложители в одном слое; их ответы конкатенируются и передаются агрегаторным моделям в следующем слое, которые синтезируют уточненный ответ. Дополнительные слои повторяют уточнение. Статья демонстрирует приросты на бенчмарках в стиле предпочтений, таких как AlpacaEval 2.0, MT-Bench и FLASK — меры качества ответа, оцениваемые экспертом, а не гарантия фактической точности. MoA также умножает стоимость токенов и добавляет задержку, поскольку выполняет множество вызовов моделей через слои, а агрегация может сгладить истинные разногласия. Argumentree.AI связано, но отличается: вместо агрегации в один синтезированный ответ, оно сохраняет индивидуальные аргументы каждой модели и заставляет каждую доступную модель оценивать аргументы каждой другой модели, выявляя консенсус и разногласия, а не скрывая их.

Назад к Коллективному ИИМногослойная архитектура LLM

Что такое
Mixture-of-Agents?

Mixture-of-Agents (MoA) рассматривает несколько LLM как сотрудничающих агентов — предложители генерируют кандидатные ответы, агрегаторы синтезируют их в один уточненный ответ. Это реальная техника с реальными компромиссами, а не волшебный переключатель точности.

Кратко

Mixture-of-Agents накладывает несколько LLM: модели-предложители составляют ответы, модели-агрегаторы объединяют их. Статья arXiv:2406.04692 показывает приросты на бенчмарках предпочтений (AlpacaEval, MT-Bench) — качество ответа, а не доказанная фактическая точность — и это стоит больше токенов и задержки, чем один вызов модели.

Откуда берется MoA

Mixture-of-Agents была представлена в статье 2024 года "Mixture-of-Agents Enhances Large Language Model Capabilities" (arXiv:2406.04692). Основное наблюдение — сотрудничество: LLM, как правило, выдают лучшие ответы, когда могут видеть и опираться на выводы других моделей — даже на модели, которые по отдельности слабее. MoA превращает это наблюдение в архитектуру.

Слоистая архитектура

MoA организована в слои. Каждый слой содержит несколько "агентов" LLM. Модели слоя каждая генерируют ответ, эти ответы конкатенируются и передаются следующему слою, модели которого действуют как агрегаторы, которые уточняют и синтезируют. Накладывание слоев повторяет уточнение.

1

Предложители генерируют кандидатов

Несколько моделей независимо отвечают на запрос на первом уровне.

2

Ответы конкатенируются

Все выходные данные первого уровня собираются в качестве справочного материала для следующего уровня.

3

Агрегаторы синтезируют

Модели второго уровня читают кандидатов и производят уточненный, объединенный ответ.

4

При желании, повторите по уровням

Дополнительные уровни продолжают уточнять; финальный агрегатор выдает ответ.

Иллюстративный пример — не фактический вывод модели

Спросите: "Должен ли наш API возвращать 200 или 202 для принятой асинхронной задачи?" Три модели-предложителя каждая составляют ответ, ссылаясь на REST-конвенции. Агрегатор читает все три, замечает, что двое предпочитают 202 Accepted с URL статуса, а один предпочитает 200, и синтезирует единую рекомендацию, которая включает в себя самые сильные доводы от каждой. Смешанный ответ читается хорошо — но если все три разделяют одно и то же заблуждение, агрегатор уверенно повторит его.

Что на самом деле показывают бенчмарки

Статья сообщает о сильных результатах на бенчмарках в стиле предпочтений — AlpacaEval 2.0, MT-Bench и FLASK — где судья (часто LLM или человек) оценивает, какой ответ более полезен или качественен. Это важное различие для разработчиков:

Честно читайте утверждение

  • • Преференции/коэффициенты выигрыша измеряют воспринимаемое качество, а не проверенную правду
  • • Более плавный, лучше организованный ответ все еще может быть фактически неверным
  • • Если у предложителей есть слепая зона, агрегирование усиливает, а не исправляет ее
  • • Каждый уровень добавляет вызовы моделей: больше токенов, более высокая стоимость, больше задержки
  • • Агрегирование может сгладить подлинное несогласие в ложную уверенность

MoA против совета LLM против консенсуса Multi-LLM

Три многомодельные схемы. Как разработчик, выбирайте по тому, что вам нужно: один отшлифованный ответ или видимое межмодельное рассуждение.

СхемаЧто она оптимизируетЧто вы получаете
Смешение агентовОдин уточненный смешанный ответАгрегаторы объединяют выходные данные предложителей; индивидуальные взгляды исчезают в синтезе
Совет LLMПрозрачный вклад каждой моделиОтвет каждой модели остается видимым; модели часто оценивают друг друга
Консенсус Multi-LLMСигнал согласия + несогласияКвантифицирует, где модели согласны (уверенность) и расходятся (оспариваемый вопрос)

Правило: выбирайте MoA, когда хотите получить единственный лучший ответ и можете заплатить за токены/латентность; выбирайте совет или оценку консенсуса, когда само разногласие является продуктом.

Где находится Argumentree.AI

Argumentree.AI разделяет предпосылку MoA — несколько моделей лучше одной — но сохраняет индивидуальные выходные данные видимыми, а не объединяет их.

Запросить все доступные модели

Каждая модель отвечает независимо — ни один предложитель/агрегатор не объединяется в один голос

Сохранить каждый аргумент

Индивидуальные аргументы за/против остаются приписанными модели, которая их сделала

Оценка моделей между собой

Каждая доступная модель оценивает аргументы каждой другой модели

Выявить консенсус и несогласие

Вы видите согласие как уверенность и несогласие как реальный вопрос

Часто задаваемые вопросы

Что такое Смешение агентов (MoA)?

Смешение агентов (MoA) — это многослойная архитектура, в которой несколько крупных языковых моделей действуют как предложители на одном уровне, а их выходные данные передаются агрегаторским моделям на следующем уровне, которые синтезируют уточненный ответ. Введено в статье 'Смешение агентов улучшает возможности крупных языковых моделей' (arXiv:2406.04692), она рассматривает несколько LLM как сотрудничающих агентов, а не полагается на одну модель.

Улучшает ли Смешение агентов точность ответов?

Оригинальная статья MoA сообщает о приростах по бенчмаркам в стиле предпочтений, таким как AlpacaEval 2.0, MT-Bench и FLASK, где судья оценивает качество ответа. Это меры предпочтения и полезности, а не гарантия фактической точности. MoA может производить более отшлифованный, лучше структурированный ответ, при этом повторяя общую фактическую ошибку, поэтому его не следует рассматривать как гарантию правды.

Каковы недостатки Смешения агентов?

MoA запускает множество моделей на нескольких уровнях, поэтому он умножает стоимость токенов и добавляет задержку по сравнению с вызовом одной модели. Агрегаторские уровни также могут сгладить подлинное несогласие между предложителями, скрывая мнения меньшинства, которые на самом деле стоило бы увидеть. Это реальная техника с реальным компромиссом по стоимости/задержке, а не бесплатное обновление.

Чем MoA отличается от совета LLM?

MoA — это архитектура синтеза: модели предложителей подают агрегаторам, которые объединяют все в один уточненный ответ. Совет LLM сохраняет видимость вклада каждой модели и часто заставляет модели оценивать или ранжировать друг друга, так что вы можете видеть, где они не согласны. MoA оптимизирует для одного сильного смешанного вывода; совет оптимизирует для прозрачности индивидуальных перспектив.

Является ли Argumentree.AI системой Смешения агентов?

Не совсем. Argumentree.AI разделяет предпосылку MoA о том, что несколько моделей лучше одной, но вместо того, чтобы агрегировать в один синтезированный ответ, он сохраняет индивидуальные аргументы каждой модели и заставляет каждую доступную модель оценивать аргументы каждой другой модели. Цель состоит в том, чтобы прозрачно выявить консенсус и несогласие, а не скрывать индивидуальные выходные данные за одним объединенным ответом.

Смотрите, как несколько моделей рассуждают — без их объединения

MoA объединяет модели в один ответ. Argumentree.AI сохраняет аргументы каждой модели видимыми и оцениваемыми коллегами.

Начать бесплатно