Рецензирование ИИ — это практика, при которой несколько моделей ИИ оценивают и оценивают аргументы друг друга, подобно академическому рецензированию, применяемому к выводам ИИ. Вместо того чтобы доверять ответу одной модели, утверждения каждой модели оцениваются другими моделями, и аргументы, которые выдерживают проверку между моделями, получают доверие. Обоснование основано на известных ограничениях использования одной модели LLM в качестве судьи: исследования документируют предвзятость позиции (предпочтение того ответа, который появляется первым), предвзятость многословия (вознаграждение более длинных ответов независимо от качества) и предвзятость самовосхваления (модель предпочитает свои собственные выводы). Распределение оценки между несколькими моделями и анонимизация того, чьи аргументы оцениваются, размывает предвзятость любого одного судьи. Поскольку разные модели склонны к различным галлюцинациям, вымышленное или неподдерживаемое утверждение часто оценивается другими моделями низко, поэтому последовательно низкие оценки между моделями сигнализируют о том, что утверждения требуют проверки человеком. Argumentree.AI реализует это, заставляя каждую доступную модель анонимно оценивать аргументы каждой другой модели, выявляя, какие утверждения широко поддерживаются, а какие являются слабыми или оспариваемыми. Это дополняет человеческое суждение, а не заменяет его.
Рецензирование ИИ имеет несколько моделей, которые оценивают аргументы друг друга — академическое рецензирование, применяемое к выводам ИИ. Анонимизированная оценка между моделями превосходит единственного судью ИИ, чьи оценки известны своей предвзятостью.
Рецензирование ИИ заставляет модели оценивать аргументы друг друга, вместо того чтобы доверять одному судье. Единственные судьи LLM показывают предвзятость позиции, многословия и самовосхваления — распределение оценок между несколькими моделями, анонимно, размывает эти предвзятости и выявляет слабые или галлюцинированные утверждения.
В академической среде утверждение не принимается, потому что его автор уверен — оно проверяется независимыми коллегами, которые оценивают аргументацию и доказательства. Рецензирование ИИ заимствует этот принцип: вместо того чтобы доверять ответу одной модели, вы заставляете несколько моделей оценивать и оценивать аргументы друг друга. Утверждения, которые выдерживают проверку между моделями, получают доверие; утверждения, которые другие модели оценивают низко, помечаются.
Соблазнительная уловка — позволить одной сильной модели оценивать выводы — шаблон "LLM как судья". Проблема: исследования судей LLM задокументировали систематические предвзятости, которые делают одного судью ненадежным.
Два дизайнерских выбора противодействуют этим предвзятостям: распределить оценку между многими моделями и анонимизировать, чьи аргументы оцениваются. Вместе они оценивают содержание, а не авторство, и усредняют любые особенности одной модели.
Каждая доступная модель независимо вносит аргументы за и против.
Аргументы анонимизируются, чтобы ни одна модель не знала, какая из них ее собственная.
Оценки распределяются между моделями, а не сосредоточены в одном судье.
Широкая поддержка = доверие; последовательно низкие оценки = слабое или галлюцинированное утверждение для проверки.
Одна модель утверждает, что "эта библиотека безопасна по памяти по дизайну" с уверенной ссылкой. В условиях анонимизированного рецензирования другие модели оценивают этот аргумент низко — несколько отмечают, что указанная гарантия не охватывает небезопасный путь взаимодействия. Низкая оценка между моделями сигнализирует о том, что утверждение нужно проверить человеком, вместо того чтобы позволить одной уверенной модели пройти с ним без оспаривания.
Каждая доступная модель оценивает аргументы каждой другой модели — анонимно — так что слабые утверждения не могут скрываться за уверенностью одной модели.
Аргументы поступают от нескольких моделей, а не из одного источника
Каждая модель оценивает аргументы каждой другой модели, не зная автора
Широко поддерживаемые аргументы поднимаются; последовательно низко оцененные помечаются
Потенциальные галлюцинации проявляются как разногласия между моделями для проверки
Рецензирование ИИ — это когда несколько моделей ИИ оценивают и оценивают аргументы друг друга, подобно академическому рецензированию, применяемому к выводам ИИ. Вместо того чтобы доверять ответу одной модели, утверждения каждой модели оцениваются другими моделями. Аргументы, которые выдерживают проверку между моделями, получают доверие; утверждения, которые другие модели оценивают низко, помечаются как слабые или потенциально галлюцинированные.
Использование одной модели LLM в качестве судьи известно своей предвзятостью. Исследования по LLM как судье документируют предвзятость позиции (предпочтение того ответа, который появляется первым), предвзятость многословия (вознаграждение более длинных ответов независимо от качества) и предвзятость самовосхваления (модель предпочитает свои собственные выводы). Распределение оценки между несколькими моделями и анонимизация того, чьи аргументы оцениваются, размывает предвзятость любого одного судьи.
Если модель знает, какое утверждение является ее собственным, предвзятость самовосхваления может заставить ее оценивать себя выше. Анонимизация аргументов перед оценкой убирает этот сигнал, так что каждая модель оценивает содержание, а не автора. Сочетание оценок от нескольких моделей дополнительно усредняет любые особенности одной модели по позиции или многословию, создавая более сбалансированный сигнал, чем у единственного судьи.
Это помогает их выявить. Поскольку разные модели склонны к различным галлюцинациям, вымышленное или неподдерживаемое утверждение от одной модели часто оценивается другими низко. Последовательно низкие оценки между моделями являются красным флагом, что утверждение требует проверки человеком. Это сигнал для обнаружения разногласий, а не гарантия — если каждая модель делит одну и ту же ошибку, рецензирование не поймает ее.
Нет. Рецензирование ИИ предназначено для приоритизации и дополнения человеческого суждения, а не для его замены. Оно показывает, какие утверждения широко поддерживаются между моделями, а какие оспариваются или слабы, чтобы люди могли сосредоточить свою проверку там, где это наиболее важно. Окончательные решения и проверки с высокими ставками остаются ответственностью человека.
Не доверяйте одному судье ИИ. Посмотрите, как каждая модель оценивает аргументы каждой другой модели.
Начать бесплатно