Рецензія AI — це практика, коли кілька моделей AI оцінюють і рецензують аргументи одна одної, подібно до академічної рецензії, застосованої до результатів AI. Замість того, щоб довіряти відповіді однієї моделі, вимоги кожної моделі оцінюються іншими моделями, і аргументи, які витримують перевірку між моделями, отримують довіру. Обґрунтування базується на відомих обмеженнях використання однієї моделі LLM як судді: дослідження документують упередження позиції (на користь тієї відповіді, яка з'являється першою), упередження обсягу (нагороджуючи довші відповіді незалежно від якості) і упередження самопідтримки (модель надає перевагу своїм власним результатам). Розподіл оцінки між кількома моделями та анонімізація того, чий аргумент оцінюється, розмиває будь-яке упередження одного судді. Оскільки різні моделі зазвичай мають різні галюцинації, вигадане або непідтримуване твердження часто оцінюється погано іншими моделями, тому послідовно низькі оцінки між моделями вказують на твердження, які потребують перевірки людиною. Argumentree.AI реалізує це, дозволяючи кожній доступній моделі анонімно оцінювати аргументи кожної іншої моделі, виявляючи, які твердження мають широку підтримку, а які є слабкими або оспорюваними. Це доповнює людське судження, а не замінює його.
Рецензія AI має кілька моделей, які оцінюють аргументи одна одної — академічна рецензія, застосована до результатів AI. Анонімна оцінка між моделями перевершує одного суддю AI, чия оцінка відома як упереджена.
Рецензія AI змушує моделі оцінювати аргументи одна одної, а не довіряти одному судді. Один суддя LLM демонструє упередження позиції, обсягу та самопідтримки — розподіл оцінок між кількома моделями, анонімно, розмиває ці упередження та виявляє слабкі або галюциновані твердження.
В академії твердження не приймається лише тому, що його автор впевнений — його перевіряють незалежні колеги, які оцінюють міркування та докази. Рецензія AI запозичує цей принцип: замість того, щоб довіряти відповіді однієї моделі, ви маєте кілька моделей, які оцінюють і рецензують аргументи одна одної. Твердження, які витримують перевірку між моделями, отримують довіру; твердження, які інші моделі оцінюють погано, позначаються.
Спокусливий шлях — дозволити одній сильній моделі оцінювати результати — шаблон "LLM як суддя". Проблема: дослідження суддів LLM документують систематичні упередження, які роблять одного суддю ненадійним.
Два дизайнерські вибори протидіють цим упередженням: розподіл оцінки між багатьма моделями та анонімізація того, чий аргумент оцінюється. Разом вони оцінюють зміст, а не авторство, і усереднюють будь-які особливості однієї моделі.
Кожна доступна модель незалежно вносить аргументи за і проти.
Аргументи анонімізуються, щоб жодна модель не знала, яка з них є її власною.
Оцінки розподіляються між моделями, а не концентруються в одному судді.
Широка підтримка = довіра; послідовно низькі оцінки = слабке або галюциноване твердження для перевірки.
Одна модель стверджує "ця бібліотека є безпечною за дизайном" з впевненим посиланням. Під час анонімної рецензії інші моделі оцінюють цей аргумент низько — кілька зазначають, що цитоване гарантія не охоплює небезпечний шлях взаємодії. Низька оцінка між моделями позначає твердження для перевірки людиною, а не дозволяє одній впевненій моделі пройти його без заперечень.
Кожна доступна модель оцінює аргументи кожної іншої моделі — анонімно — так що слабкі твердження не можуть ховатися за впевненістю однієї моделі.
Аргументи надходять з кількох моделей, а не з одного джерела
Кожна модель оцінює аргументи кожної іншої моделі, не знаючи автора
Широко підтримувані аргументи підвищуються; послідовно низько оцінені позначаються
Потенційні галюцинації виявляються як розбіжності між моделями для перевірки
Рецензія AI — це коли кілька моделей AI оцінюють і рецензують аргументи одна одної, подібно до академічної рецензії, застосованої до результатів AI. Замість того, щоб довіряти відповіді однієї моделі, вимоги кожної моделі оцінюються іншими моделями. Аргументи, які витримують перевірку між моделями, отримують довіру; твердження, які інші моделі оцінюють погано, позначаються як слабкі або потенційно галюциновані.
Використання одного LLM як судді відомо як упереджене. Дослідження про LLM як суддю документують упередження позиції (на користь тієї відповіді, яка з'являється першою), упередження обсягу (нагороджуючи довші відповіді незалежно від якості) та упередження самопідтримки (модель надає перевагу своїм власним результатам). Розподіл оцінки між кількома моделями та анонімізація того, чий аргумент оцінюється, розмиває будь-яке ідіосинкразичне упередження одного судді.
Якщо модель знає, яке твердження є її власним, упередження самопідтримки може змусити її оцінити себе вище. Анонімізація аргументів перед оцінкою усуває цей сигнал, тому кожна модель оцінює зміст, а не автора. Поєднання оцінок з кількох моделей ще більше усереднює будь-які особливості позиції або обсягу однієї моделі, створюючи більш збалансований сигнал, ніж один суддя.
Це допомагає їх виявити. Оскільки різні моделі зазвичай мають різні галюцинації, вигадане або непідтримуване твердження з однієї моделі часто оцінюється погано іншими. Послідовно низькі оцінки між моделями є червоним прапором, що твердження потребує перевірки людиною. Це сигнал виявлення розбіжностей, а не гарантія — якщо кожна модель має ту ж помилку, рецензія не виявить її.
Ні. Рецензія AI розроблена для того, щоб пріоритетизувати та доповнювати людське судження, а не замінювати його. Вона показує, які твердження мають широку підтримку між моделями, а які оспорюються або є слабкими, щоб люди могли зосередити свою перевірку там, де це найбільше важливо. Остаточні рішення та перевірка з високими ставками залишаються відповідальністю людини.
Не довіряйте одному судді AI. Дивіться, як кожна модель оцінює аргументи кожної іншої моделі.
Почати безкоштовно