Що таке рецензія AI?

Рецензія AI — це практика, коли кілька моделей AI оцінюють і рецензують аргументи одна одної, подібно до академічної рецензії, застосованої до результатів AI. Замість того, щоб довіряти відповіді однієї моделі, вимоги кожної моделі оцінюються іншими моделями, і аргументи, які витримують перевірку між моделями, отримують довіру. Обґрунтування базується на відомих обмеженнях використання однієї моделі LLM як судді: дослідження документують упередження позиції (на користь тієї відповіді, яка з'являється першою), упередження обсягу (нагороджуючи довші відповіді незалежно від якості) і упередження самопідтримки (модель надає перевагу своїм власним результатам). Розподіл оцінки між кількома моделями та анонімізація того, чий аргумент оцінюється, розмиває будь-яке упередження одного судді. Оскільки різні моделі зазвичай мають різні галюцинації, вигадане або непідтримуване твердження часто оцінюється погано іншими моделями, тому послідовно низькі оцінки між моделями вказують на твердження, які потребують перевірки людиною. Argumentree.AI реалізує це, дозволяючи кожній доступній моделі анонімно оцінювати аргументи кожної іншої моделі, виявляючи, які твердження мають широку підтримку, а які є слабкими або оспорюваними. Це доповнює людське судження, а не замінює його.

Назад до Колективного AI ІнтелектуОцінка між моделями

Що таке
Рецензія AI?

Рецензія AI має кілька моделей, які оцінюють аргументи одна одної — академічна рецензія, застосована до результатів AI. Анонімна оцінка між моделями перевершує одного суддю AI, чия оцінка відома як упереджена.

TL;DR

Рецензія AI змушує моделі оцінювати аргументи одна одної, а не довіряти одному судді. Один суддя LLM демонструє упередження позиції, обсягу та самопідтримки — розподіл оцінок між кількома моделями, анонімно, розмиває ці упередження та виявляє слабкі або галюциновані твердження.

Рецензія, застосована до AI

В академії твердження не приймається лише тому, що його автор впевнений — його перевіряють незалежні колеги, які оцінюють міркування та докази. Рецензія AI запозичує цей принцип: замість того, щоб довіряти відповіді однієї моделі, ви маєте кілька моделей, які оцінюють і рецензують аргументи одна одної. Твердження, які витримують перевірку між моделями, отримують довіру; твердження, які інші моделі оцінюють погано, позначаються.

Чому не просто використовувати один AI як суддю?

Спокусливий шлях — дозволити одній сильній моделі оцінювати результати — шаблон "LLM як суддя". Проблема: дослідження суддів LLM документують систематичні упередження, які роблять одного суддю ненадійним.

Документовані упередження одного судді

  • Упередження позиції — на користь тієї відповіді, яка подається першою
  • Упередження обсягу — нагороджуючи довші відповіді незалежно від якості
  • Упередження самопідтримки — модель надає перевагу своїм власним результатам
  • Ідіосинкразії одного судді застосовуються до кожної оцінки, яку він робить

Як анонімна оцінка між моделями допомагає

Два дизайнерські вибори протидіють цим упередженням: розподіл оцінки між багатьма моделями та анонімізація того, чий аргумент оцінюється. Разом вони оцінюють зміст, а не авторство, і усереднюють будь-які особливості однієї моделі.

1

Збирайте аргументи з багатьох моделей

Кожна доступна модель незалежно вносить аргументи за і проти.

2

Приберіть авторство

Аргументи анонімізуються, щоб жодна модель не знала, яка з них є її власною.

3

Кожна модель оцінює кожен аргумент

Оцінки розподіляються між моделями, а не концентруються в одному судді.

4

Агрегуйте сигнал між моделями

Широка підтримка = довіра; послідовно низькі оцінки = слабке або галюциноване твердження для перевірки.

Ілюстративний приклад — не фактичний вихід моделі

Одна модель стверджує "ця бібліотека є безпечною за дизайном" з впевненим посиланням. Під час анонімної рецензії інші моделі оцінюють цей аргумент низько — кілька зазначають, що цитоване гарантія не охоплює небезпечний шлях взаємодії. Низька оцінка між моделями позначає твердження для перевірки людиною, а не дозволяє одній впевненій моделі пройти його без заперечень.

Рецензія AI в Argumentree.AI

Кожна доступна модель оцінює аргументи кожної іншої моделі — анонімно — так що слабкі твердження не можуть ховатися за впевненістю однієї моделі.

Кілька незалежних моделей

Аргументи надходять з кількох моделей, а не з одного джерела

Анонімна оцінка між моделями

Кожна модель оцінює аргументи кожної іншої моделі, не знаючи автора

Підтримка стає сигналом

Широко підтримувані аргументи підвищуються; послідовно низько оцінені позначаються

Слабкі твердження виявляються

Потенційні галюцинації виявляються як розбіжності між моделями для перевірки

Часто задавані питання

Що таке рецензія AI?

Рецензія AI — це коли кілька моделей AI оцінюють і рецензують аргументи одна одної, подібно до академічної рецензії, застосованої до результатів AI. Замість того, щоб довіряти відповіді однієї моделі, вимоги кожної моделі оцінюються іншими моделями. Аргументи, які витримують перевірку між моделями, отримують довіру; твердження, які інші моделі оцінюють погано, позначаються як слабкі або потенційно галюциновані.

Чому рецензія AI краща за одного суддю AI?

Використання одного LLM як судді відомо як упереджене. Дослідження про LLM як суддю документують упередження позиції (на користь тієї відповіді, яка з'являється першою), упередження обсягу (нагороджуючи довші відповіді незалежно від якості) та упередження самопідтримки (модель надає перевагу своїм власним результатам). Розподіл оцінки між кількома моделями та анонімізація того, чий аргумент оцінюється, розмиває будь-яке ідіосинкразичне упередження одного судді.

Як анонімна оцінка між моделями зменшує упередження?

Якщо модель знає, яке твердження є її власним, упередження самопідтримки може змусити її оцінити себе вище. Анонімізація аргументів перед оцінкою усуває цей сигнал, тому кожна модель оцінює зміст, а не автора. Поєднання оцінок з кількох моделей ще більше усереднює будь-які особливості позиції або обсягу однієї моделі, створюючи більш збалансований сигнал, ніж один суддя.

Чи може рецензія AI виявити галюцинації?

Це допомагає їх виявити. Оскільки різні моделі зазвичай мають різні галюцинації, вигадане або непідтримуване твердження з однієї моделі часто оцінюється погано іншими. Послідовно низькі оцінки між моделями є червоним прапором, що твердження потребує перевірки людиною. Це сигнал виявлення розбіжностей, а не гарантія — якщо кожна модель має ту ж помилку, рецензія не виявить її.

Чи замінює рецензія AI людську рецензію?

Ні. Рецензія AI розроблена для того, щоб пріоритетизувати та доповнювати людське судження, а не замінювати його. Вона показує, які твердження мають широку підтримку між моделями, а які оспорюються або є слабкими, щоб люди могли зосередити свою перевірку там, де це найбільше важливо. Остаточні рішення та перевірка з високими ставками залишаються відповідальністю людини.

Нехай моделі рецензують одна одну

Не довіряйте одному судді AI. Дивіться, як кожна модель оцінює аргументи кожної іншої моделі.

Почати безкоштовно