اعتبارسنجی مدلهای متقابل یک تکنیک برای تأیید خروجیهای هوش مصنوعی با پرسش از چندین مدل مستقل هوش مصنوعی با همان سوال و مقایسه پاسخهای آنها است. زیرا مدلهای مختلف (GPT، کلود، جمنای، گراک، پرپلکسیتی و غیره) دادههای آموزشی، معماریها و نقاط کور متفاوتی دارند، به طور متفاوتی توهم ایجاد میکنند. وقتی یک مدل خطا میکند، معمولاً دیگران همان اشتباه را نمیکنند. Argumentree.AI اعتبارسنجی مدلهای متقابل را با این روش پیادهسازی میکند که هر مدل به طور مستقل استدلالها را ایجاد میکند و سپس هر مدل به هر استدلال از هر مدل دیگر امتیاز میدهد. عدم توافق خطاهای بالقوه را نمایان میکند؛ توافق اعتماد به نفس را افزایش میدهد.
اعتبارسنجی مدلهای متقابل از چندین مدل هوش مصنوعی برای تأیید خروجیهای یکدیگر استفاده میکند. مدلهای مختلف نقاط کور متفاوتی دارند—خطاهایی که از یک مدل عبور میکنند، توسط دیگران شناسایی میشوند.
اعتبارسنجی مدلهای متقابل خروجیها را از چندین مدل مستقل هوش مصنوعی مقایسه میکند. وقتی مدلها اختلاف نظر دارند، آن اختلاف نظر توهمات بالقوه را نمایان میکند. وقتی آنها توافق دارند، اعتماد به نفس افزایش مییابد.
اعتبارسنجی مدلهای متقابل کار میکند زیرا مدلهای هوش مصنوعی سیستمهای واقعاً مستقلی هستند. آنها در:
خزندههای وب مختلف، کتابها، مقالات و مجموعههای داده اختصاصی
GPT در مقابل کلود در مقابل جمنای از رویکردهای بنیادی متفاوتی استفاده میکنند
هر مدل در تاریخ متفاوتی یادگیری را متوقف میکند
اولویتهای مختلف: کمک، ایمنی، سبک استدلال
هر مدل به طور متفاوتی توهم میزند و در زمینههای مختلف
OpenAI، Anthropic، Google اهداف طراحی متفاوتی دارند
این استقلال ارزشمند است. وقتی GPT یک استناد را جعل میکند، معمولاً کلود همان را اختراع نمیکند. وقتی جمنای یک خطای منطقی میکند، گراک معمولاً آن را شناسایی میکند. هرچه مدلها مستقلتر باشند، توافق آنها و عدم توافق آنها ارزشمندتر است.
هر مدل هوش مصنوعی همان سوال را دریافت میکند اما پاسخ خود را به طور مستقل تولید میکند. هیچ مدلی نمیبیند که دیگران چه گفتهاند. این مانع از کپی کردن پاسخهای یکدیگر (و اشتباهات یکدیگر) میشود.
پس از اینکه همه مدلها استدلالهای خود را تولید کردند، هر مدل هر استدلال را از هر مدل دیگر امتیازدهی میکند. این مرحله کلیدی است—مدلها به طور فعال کار یکدیگر را ارزیابی میکنند و به دنبال نقصهای منطقی، ادعاهای بدون پشتیبانی و احتمال جعل میگردند.
زمانی که چندین مدل یک استدلال را به طور ضعیف امتیازدهی میکنند، این یک علامت هشدار است. ممکن است استدلال شامل توهم، خطای منطقی یا ادعای بدون پشتیبانی باشد. این عدم توافقها مشکلاتی را نمایان میکند که هر مدل منفرد با اطمینان به عنوان واقعیت ارائه میدهد.
استدلالهایی که همه مدلها به شدت امتیازدهی میکنند، اجماع بالایی دارند. در حالی که این به معنای اثبات حقیقت نیست، اجماع بالا یک سیگنال اعتماد معنادار است—سیستمهای مستقل توافق دارند و احتمال توهم مشترک را کاهش میدهند.
به طور همزمان از GPT، کلود، جمنای، گراک و پرپلکسی سوال کنید
هر مدل هر استدلال را از هر مدل دیگر امتیازدهی میکند
استدلالهای با امتیاز پایین به طور خودکار برای بررسی نمایان میشوند
ببینید کدام مدل چه گفت—هرگز ترکیب سیاهچالهای
اعتبارسنجی متقابل مدل عمل استفاده از چندین مدل هوش مصنوعی مستقل برای تأیید خروجیهای یکدیگر است. با پرسش از چندین مدل با همان سوال و مقایسه پاسخهای آنها، میتوانید توهمات را شناسایی کنید، خطاها را بگیرید و به ادعاهایی که همه مدلها بر روی آن توافق دارند، اعتماد کنید.
مدلهای هوش مصنوعی مختلف دادههای آموزشی، معماریها، قطعهای دانش و حالتهای شکست متفاوتی دارند. زمانی که یک مدل توهم میزند یا خطایی مرتکب میشود، معمولاً مدلهای دیگر همان اشتباه را نمیکنند. این استقلال است که اعتبارسنجی متقابل را مؤثر میسازد—خطاهایی که از یک مدل عبور میکنند، توسط دیگران شناسایی میشوند.
تحقیقات نشان میدهد که ۳-۵ مدل مستقل اعتبارسنجی قوی را فراهم میکنند. مدلهای بیشتر میتوانند برای تصمیمات با ریسک بالا کمک کنند، اما با بازدهی کاهشی. کلید استقلال واقعی است—مدلهایی از شرکتهای مختلف با معماریهای متفاوت از چندین نسخه از همان مدل ارزشمندتر هستند.
بله، این میتواند زمانی اتفاق بیفتد که: (۱) همه مدلها یک تعصب آموزشی مشترک داشته باشند، (۲) ادعا برای دادههای آموزشی هیچ مدلی خیلی جدید باشد، یا (۳) ادعا نیاز به تخصص در حوزهای داشته باشد که هیچ یک از مدلها ندارند. اجماع متقابل مدل نیاز به تأیید انسانی را کاهش میدهد اما آن را از بین نمیبرد.
روشهای تجمیع سنتی خروجیهای مدل را ترکیب میکنند تا دقت پیشبینی را بهبود بخشند. اعتبارسنجی متقابل مدل بر روی تشخیص عدم توافق تمرکز دارد—شناسایی جایی که مدلها با یکدیگر تناقض دارند، که سیگنالی برای خطاهای بالقوه یا ادعاهای واقعاً مورد مناقشه است که نیاز به بررسی انسانی دارد.
اعتبارسنجی مدلهای متقابل خطاهایی را شناسایی میکند که ابزارهای مدل واحد از دست میدهند.
تحقیق رایگان را شروع کنید