زمانی که از چندین مدل هوش مصنوعی سوال میکنید و "87% توافق" را مشاهده میکنید، آن عدد در واقع چه معنایی دارد؟ چگونه محاسبه میشود و باید با آن چه کنید؟ این راهنما توضیح میدهد که نمره توافق چگونه کار میکند و چگونه نتایج را تفسیر کنید.
نمره توافق چیست؟
یک امتیاز توافق میزان توافق بین چندین مدل هوش مصنوعی را هنگام پاسخ دادن به یک سوال مشابه اندازهگیری میکند. این یک میانگین ساده از امتیازهای اعتماد نیست—بلکه معیاری از توافق بین مدلها است.
چگونه اجماع محاسبه میشود
پرسش چندین مدل
همان سوال به GPT-4، کلاود، جمنای، گراک و غیره ارسال شد.
ادعای کلیدی را استخراج کنید
هر پاسخ به ادعاهای واقعی مجزا تقسیم شده است
ادعاها را متقابل اعتبارسنجی کنید
هر مدل دقت ادعاهای مدلهای دیگر را ارزیابی میکند.
محاسبه توافق
درصد ادعاهایی که بیشتر مدلها بر روی آن توافق دارند
تفسیر سطوح توافق
بیش از 90% — توافق قوی
بیشتر مدلها بر روی بیشتر ادعاها توافق دارند. در حالی که این به معنای اثبات دقت نیست، اما تأیید مستقل در دادههای آموزشی و معماریهای مختلف را نشان میدهد. تأیید جزئی معمولاً کافی است.
70-89% — توافق متوسط
توافق کلی با برخی انحرافات در جزئیات. ادعاهای اصلی احتمالاً قابل اعتماد هستند، اما جزئیات باید تأیید شوند. به جایی که مدلها اختلاف نظر دارند توجه کنید.
۵۰-۶۹٪ — توافق پایین
اختلاف قابل توجهی وجود دارد. این اغلب نشان میدهد که سوال به حوزههایی مربوط میشود که دانش هوش مصنوعی در آنها نامشخص است، موضوع واقعاً جنجالی است، یا سوال مبهم است. تحقیقات انسانی لازم است.
<50% — هیچ توافقی وجود ندارد
مدلها به طور فعال با یکدیگر اختلاف نظر دارند. از اطلاعات تولید شده توسط هوش مصنوعی در اینجا بدون تأیید منبع اصلی استفاده نکنید. این دادهها ارزشمند هستند - به شما میگویند که کجا هوش مصنوعی نمیتواند کمک کند و تخصص انسانی ضروری است.
چرا توافق بیشتر از اعتماد اهمیت دارد
مدلهای هوش مصنوعی فردی اغلب حتی زمانی که اشتباه هستند، اعتماد به نفس بالایی نشان میدهند. یک مدل که میگوید "من ۹۵٪ مطمئن هستم" درباره الگوی داخلی تطبیق مدل صحبت میکند، نه درباره دقت در دنیای واقعی. اجماع متفاوت است.
اعتماد به مدل تکگانه
- •بر اساس تطبیق الگوهای داخلی
- •با دقت همبستگی خوبی ندارد
- •میتواند برای توهمات بالا باشد
- •یک مجموعه داده آموزشی، یک دیدگاه
اجماع چندمدلی
- •بر اساس توافق مستقل
- •کالیبره شده برای اعتبارسنجی متقابل
- •توهمات معمولاً تکرار نمیشوند
- •چندین مجموعه داده، چندین دیدگاه
آنچه توافق به شما نمیگوید
اجماع بالا دلیلی بر حقیقت نیست. همه مدلها میتوانند از دادههای آموزشی همپوشان یک نقطه کور یا خطای مشابه داشته باشند. اجماع به شما میگوید که کجا میتوانید اعتماد کالیبره شده داشته باشید، نه قطعیت.
برای تصمیمات با ریسک بالا، امتیازهای توافق به شما کمک میکنند تا تلاشهای تأیید را تخصیص دهید: زمان کمتری بر روی ادعاهای با توافق بالا و زمان بیشتری بر روی ادعاهای با توافق پایین.
درک نمرات توافق، نحوه استفاده شما از تحقیقات هوش مصنوعی را تغییر میدهد. به جای اینکه بپرسید "آیا میتوانم به این پاسخ اعتماد کنم؟"، میتوانید بپرسید "این ادعای خاص به چه میزان تأیید نیاز دارد؟" این یک سوال بسیار عملیتر است.
سوالات متداول
نمره توافق چیست؟
معیاری از توافق بین مدلها — اینکه چند مدل هوش مصنوعی با یکدیگر چقدر توافق دارند — نه اعتماد به نفس خودگزارش شده یک مدل واحد.
چگونه سطوح توافق را تفسیر میکنید؟
باندهای پست: ۹۰٪+ قوی، ۷۰–۸۹٪ متوسط، ۵۰–۶۹٪ پایین (بررسی کنید) و زیر ۵۰٪ به معنای تأیید مستقل است.
یک امتیاز توافقی به شما چه چیزی نمیگوید؟
این نشان نمیدهد که پاسخ توافق شده درست است — پست میگوید از امتیازها برای تخصیص تلاش تأیید استفاده کنید، نه به عنوان مدرکی برای صحت.