Ang AI peer review ay ang pagsasanay ng pagkakaroon ng maraming modelo ng AI na suriin at i-rate ang mga argumento ng bawat isa, katulad ng akademikong peer review na inilalapat sa mga output ng AI. Sa halip na umasa sa sagot ng isang solong modelo, ang mga pahayag ng bawat modelo ay sinusuri ng iba pang mga modelo, at ang mga argumento na nakaligtas sa cross-model scrutiny ay nagkakaroon ng tiwala. Ang rasyonal ay nakabatay sa mga kilalang limitasyon ng paggamit ng isang solong LLM bilang hukom: ang mga dokumento ng pananaliksik ay nagdodokumento ng bias sa posisyon (pabor sa anumang sagot na lumitaw muna), bias sa verbosity (pagsusukli ng mas mahahabang sagot anuman ang kalidad), at bias ng self-enhancement (isang modelo na mas pinapaboran ang sarili nitong mga output). Ang pagpapalaganap ng pagsusuri sa maraming modelo at ang pag-anonymize kung aling argumento ang nirereview ay nagpapalambot sa anumang idiosyncratic bias ng isang hukom. Dahil ang iba't ibang modelo ay may posibilidad na mag-hallucinate ng iba, ang isang fabricated o unsupported na pahayag ay kadalasang nirereview ng mababa ng iba pang mga modelo, kaya ang patuloy na mababang cross-model ratings ay nag-flag ng mga pahayag na nangangailangan ng human verification. Ipinapatupad ito ng Argumentree.AI sa pamamagitan ng pagkakaroon ng bawat available na modelo na i-rate ang mga argumento ng bawat isa nang anonymously, na nagpapakita kung aling mga pahayag ang malawak na sinusuportahan at kung aling mga mahina o contested. Pinapalakas nito ang paghuhusga ng tao sa halip na palitan ito.
Ang AI peer review ay may maraming modelo na nag-rate sa mga argumento ng bawat isa — akademikong peer review, na inilalapat sa mga output ng AI. Ang anonymized cross-model rating ay mas mahusay kaysa sa isang solong hukom ng AI, na ang mga rating ay kilalang biased.
Ang AI peer review ay nagpapagawa sa mga modelo na i-rate ang mga argumento ng bawat isa sa halip na umasa sa isang hukom. Ang mga solong hukom ng LLM ay nagpapakita ng bias sa posisyon, verbosity, at self-enhancement — ang pagpapalaganap ng mga rating sa maraming modelo, anonymously, ay nagpapalambot sa mga bias na iyon at nagpapakita ng mahihinang o hallucinated na mga pahayag.
Sa akademya, ang isang pahayag ay hindi tinatanggap dahil ang may-akda nito ay tiwala — ito ay sinusuri ng mga independiyenteng kapwa na humuhusga sa pangangatwiran at ebidensya. Ang AI peer review ay humihiram ng prinsipyong iyon: sa halip na umasa sa sagot ng isang modelo, mayroon kang maraming modelo na suriin at i-rate ang mga argumento ng bawat isa. Ang mga pahayag na nakaligtas sa cross-model scrutiny ay nagkakaroon ng tiwala; ang mga pahayag na mababa ang rating ng ibang mga modelo ay na-flag.
Isang nakakaakit na shortcut ang hayaan ang isang solong malakas na modelo na i-grade ang mga output — ang "LLM-as-a-judge" na pattern. Ang problema: ang pananaliksik sa mga hukom ng LLM ay nagdodokumento ng sistematikong bias na ginagawang hindi maaasahan ang isang hukom.
Dalawang pagpipilian sa disenyo ang lumalaban sa mga bias na iyon: ipakalat ang rating sa maraming modelo, at i-anonymize kung aling argumento ang nirereview. Sama-sama silang humuhusga sa nilalaman, hindi sa may-akda, at pinapantay ang anumang quirks ng isang solong modelo.
Bawat available na modelo ay nag-aambag ng mga pro/con na argumento nang nakapag-iisa.
Ang mga argumento ay ina-anonymize upang walang modelo ang makaalam kung aling isa ang kanya.
Ang mga rating ay ipinamamahagi sa mga modelo, hindi nakatuon sa isang hukom.
Malawak na suporta = tiwala; patuloy na mababang rating = isang mahina o hallucinated na pahayag na dapat i-verify.
Isang modelo ang nagsasabi "ang library na ito ay memory-safe sa disenyo" na may tiwala na citation. Sa ilalim ng anonymized peer review, ang ibang mga modelo ay nag-rate ng mababa sa argumentong iyon — ilang mga modelo ang nagtuturo na ang cited guarantee ay hindi sumasaklaw sa unsafe interop path. Ang mababang cross-model rating ay nag-flag ng pahayag para sa isang tao na suriin, sa halip na hayaan ang isang tiwala na modelo na dalhin ito nang walang hamon.
Bawat available na modelo ay nag-rate sa mga argumento ng bawat isa — anonymously — kaya ang mga mahihinang pahayag ay hindi makakapagtago sa likod ng tiwala ng isang modelo.
Ang mga argumento ay nagmumula sa ilang mga modelo, hindi sa isang solong pinagmulan
Bawat modelo ay nag-rate sa mga argumento ng bawat isa nang hindi alam ang may-akda
Ang malawak na sinusuportahang mga argumento ay umaangat; ang mga patuloy na mababang-rated ay na-flag
Ang mga potensyal na hallucinations ay lumilitaw bilang cross-model disagreement na dapat i-verify
Ang AI peer review ay kapag maraming modelo ng AI ang nagsusuri at nag-rate sa mga argumento ng bawat isa, katulad ng akademikong peer review na inilalapat sa mga output ng AI. Sa halip na umasa sa sagot ng isang modelo, ang mga pahayag ng bawat modelo ay sinusuri ng iba pang mga modelo. Ang mga argumento na nakaligtas sa cross-model scrutiny ay nagkakaroon ng tiwala; ang mga pahayag na mababa ang rating ng ibang mga modelo ay na-flag bilang mahina o potensyal na hallucinated.
Ang paggamit ng isang LLM bilang hukom ay kilalang biased. Ang pananaliksik sa LLM-as-a-judge ay nagdodokumento ng bias sa posisyon (pabor sa anumang sagot na lumitaw muna), bias sa verbosity (pagsusukli ng mas mahahabang sagot anuman ang kalidad), at bias ng self-enhancement (isang modelo na mas pinapaboran ang sarili nitong mga output). Ang pagpapalaganap ng pagsusuri sa maraming modelo at ang pag-anonymize kung aling argumento ang nirereview ay nagpapalambot sa anumang idiosyncratic bias ng isang hukom.
Kung alam ng isang modelo kung aling argumento ang kanya, ang bias ng self-enhancement ay maaaring magpataas ng rating nito. Ang pag-anonymize ng mga argumento bago ang rating ay nag-aalis ng cue na iyon, kaya ang bawat modelo ay humuhusga sa nilalaman sa halip na sa may-akda. Ang pagsasama ng mga rating mula sa ilang mga modelo ay higit pang nagpapantay sa anumang quirks ng posisyon o verbosity ng isang modelo, na nagbubunga ng mas balanseng signal kaysa sa isang solong hukom.
Nakakatulong itong ipakita ang mga ito. Dahil ang iba't ibang modelo ay may posibilidad na mag-hallucinate ng iba, ang isang fabricated o unsupported na pahayag mula sa isang modelo ay kadalasang nirereview ng mababa ng iba. Ang patuloy na mababang cross-model ratings ay isang red flag na ang isang pahayag ay nangangailangan ng human verification. Ito ay isang signal ng pagtukoy ng disagreement, hindi isang garantiya — kung ang bawat modelo ay nagbabahagi ng parehong error, hindi mahuhuli ng peer review ito.
Hindi. Ang AI peer review ay dinisenyo upang bigyang-priyoridad at palakasin ang paghuhusga ng tao, hindi upang palitan ito. Sinasabi nito sa iyo kung aling mga pahayag ang malawak na sinusuportahan sa mga modelo at kung aling mga contested o mahina, kaya ang mga tao ay makapagtuon ng kanilang verification kung saan ito pinakamahalaga. Ang mga pangwakas na desisyon at mataas na stake na verification ay nananatiling responsibilidad ng tao.
Huwag umasa sa isang hukom ng AI. Tingnan kung paano nag-rate ang bawat modelo sa mga argumento ng bawat isa.
Magsimula ng Libre