Что такое рецензирование ИИ?

Рецензирование ИИ — это практика, при которой несколько моделей ИИ оценивают и оценивают аргументы друг друга, подобно академическому рецензированию, применяемому к выводам ИИ. Вместо того чтобы доверять ответу одной модели, утверждения каждой модели оцениваются другими моделями, и аргументы, которые выдерживают проверку между моделями, получают доверие. Обоснование основано на известных ограничениях использования одной модели LLM в качестве судьи: исследования документируют предвзятость позиции (предпочтение того ответа, который появляется первым), предвзятость многословия (вознаграждение более длинных ответов независимо от качества) и предвзятость самовосхваления (модель предпочитает свои собственные выводы). Распределение оценки между несколькими моделями и анонимизация того, чьи аргументы оцениваются, размывает предвзятость любого одного судьи. Поскольку разные модели склонны к различным галлюцинациям, вымышленное или неподдерживаемое утверждение часто оценивается другими моделями низко, поэтому последовательно низкие оценки между моделями сигнализируют о том, что утверждения требуют проверки человеком. Argumentree.AI реализует это, заставляя каждую доступную модель анонимно оценивать аргументы каждой другой модели, выявляя, какие утверждения широко поддерживаются, а какие являются слабыми или оспариваемыми. Это дополняет человеческое суждение, а не заменяет его.

Назад к Коллективному ИИОценка между моделями

Что такое
рецензирование ИИ?

Рецензирование ИИ имеет несколько моделей, которые оценивают аргументы друг друга — академическое рецензирование, применяемое к выводам ИИ. Анонимизированная оценка между моделями превосходит единственного судью ИИ, чьи оценки известны своей предвзятостью.

Кратко

Рецензирование ИИ заставляет модели оценивать аргументы друг друга, вместо того чтобы доверять одному судье. Единственные судьи LLM показывают предвзятость позиции, многословия и самовосхваления — распределение оценок между несколькими моделями, анонимно, размывает эти предвзятости и выявляет слабые или галлюцинированные утверждения.

Рецензирование, применяемое к ИИ

В академической среде утверждение не принимается, потому что его автор уверен — оно проверяется независимыми коллегами, которые оценивают аргументацию и доказательства. Рецензирование ИИ заимствует этот принцип: вместо того чтобы доверять ответу одной модели, вы заставляете несколько моделей оценивать и оценивать аргументы друг друга. Утверждения, которые выдерживают проверку между моделями, получают доверие; утверждения, которые другие модели оценивают низко, помечаются.

Почему бы не использовать один ИИ в качестве судьи?

Соблазнительная уловка — позволить одной сильной модели оценивать выводы — шаблон "LLM как судья". Проблема: исследования судей LLM задокументировали систематические предвзятости, которые делают одного судью ненадежным.

Задокументированные предвзятости единственного судьи

  • Предвзятость позиции — предпочтение того ответа, который представлен первым
  • Предвзятость многословия — вознаграждение более длинных ответов независимо от качества
  • Предвзятость самовосхваления — модель предпочитает свои собственные выводы
  • Индивидуальные особенности единственного судьи применяются к каждой оценке, которую он делает

Как анонимизированная оценка между моделями помогает

Два дизайнерских выбора противодействуют этим предвзятостям: распределить оценку между многими моделями и анонимизировать, чьи аргументы оцениваются. Вместе они оценивают содержание, а не авторство, и усредняют любые особенности одной модели.

1

Собрать аргументы от многих моделей

Каждая доступная модель независимо вносит аргументы за и против.

2

Убрать авторство

Аргументы анонимизируются, чтобы ни одна модель не знала, какая из них ее собственная.

3

Каждая модель оценивает каждый аргумент

Оценки распределяются между моделями, а не сосредоточены в одном судье.

4

Агрегировать сигнал между моделями

Широкая поддержка = доверие; последовательно низкие оценки = слабое или галлюцинированное утверждение для проверки.

Иллюстративный пример — не фактический вывод модели

Одна модель утверждает, что "эта библиотека безопасна по памяти по дизайну" с уверенной ссылкой. В условиях анонимизированного рецензирования другие модели оценивают этот аргумент низко — несколько отмечают, что указанная гарантия не охватывает небезопасный путь взаимодействия. Низкая оценка между моделями сигнализирует о том, что утверждение нужно проверить человеком, вместо того чтобы позволить одной уверенной модели пройти с ним без оспаривания.

Рецензирование ИИ в Argumentree.AI

Каждая доступная модель оценивает аргументы каждой другой модели — анонимно — так что слабые утверждения не могут скрываться за уверенностью одной модели.

Несколько независимых моделей

Аргументы поступают от нескольких моделей, а не из одного источника

Анонимизированная кросс-оценка

Каждая модель оценивает аргументы каждой другой модели, не зная автора

Поддержка становится сигналом

Широко поддерживаемые аргументы поднимаются; последовательно низко оцененные помечаются

Слабые утверждения всплывают

Потенциальные галлюцинации проявляются как разногласия между моделями для проверки

Часто задаваемые вопросы

Что такое рецензирование ИИ?

Рецензирование ИИ — это когда несколько моделей ИИ оценивают и оценивают аргументы друг друга, подобно академическому рецензированию, применяемому к выводам ИИ. Вместо того чтобы доверять ответу одной модели, утверждения каждой модели оцениваются другими моделями. Аргументы, которые выдерживают проверку между моделями, получают доверие; утверждения, которые другие модели оценивают низко, помечаются как слабые или потенциально галлюцинированные.

Почему рецензирование ИИ лучше, чем один судья ИИ?

Использование одной модели LLM в качестве судьи известно своей предвзятостью. Исследования по LLM как судье документируют предвзятость позиции (предпочтение того ответа, который появляется первым), предвзятость многословия (вознаграждение более длинных ответов независимо от качества) и предвзятость самовосхваления (модель предпочитает свои собственные выводы). Распределение оценки между несколькими моделями и анонимизация того, чьи аргументы оцениваются, размывает предвзятость любого одного судьи.

Как анонимизированная оценка между моделями снижает предвзятость?

Если модель знает, какое утверждение является ее собственным, предвзятость самовосхваления может заставить ее оценивать себя выше. Анонимизация аргументов перед оценкой убирает этот сигнал, так что каждая модель оценивает содержание, а не автора. Сочетание оценок от нескольких моделей дополнительно усредняет любые особенности одной модели по позиции или многословию, создавая более сбалансированный сигнал, чем у единственного судьи.

Может ли рецензирование ИИ выявить галлюцинации?

Это помогает их выявить. Поскольку разные модели склонны к различным галлюцинациям, вымышленное или неподдерживаемое утверждение от одной модели часто оценивается другими низко. Последовательно низкие оценки между моделями являются красным флагом, что утверждение требует проверки человеком. Это сигнал для обнаружения разногласий, а не гарантия — если каждая модель делит одну и ту же ошибку, рецензирование не поймает ее.

Заменяет ли рецензирование ИИ человеческое рецензирование?

Нет. Рецензирование ИИ предназначено для приоритизации и дополнения человеческого суждения, а не для его замены. Оно показывает, какие утверждения широко поддерживаются между моделями, а какие оспариваются или слабы, чтобы люди могли сосредоточить свою проверку там, где это наиболее важно. Окончательные решения и проверки с высокими ставками остаются ответственностью человека.

Позвольте моделям рецензировать друг друга

Не доверяйте одному судье ИИ. Посмотрите, как каждая модель оценивает аргументы каждой другой модели.

Начать бесплатно