اجماع چندین مدل زبان بزرگ سطح توافقی است که زمانی به دست میآید که چندین مدل زبان بزرگ مختلف به طور مستقل درباره یک ادعا استدلال کنند و استدلالهای یکدیگر را ارزیابی کنند. این با نمونهبرداری از یک مدل یا خودسازگاری متفاوت است، که به طور مکرر یک مدل را نمونهبرداری میکند و تعصبات آن مدل را به اشتراک میگذارد. همچنین با ترکیب آماری متفاوت است، که خروجیها را به یک پیشبینی میانگین ترکیب میکند: اجماع چندین مدل زبان بزرگ استدلالهای فردی را حفظ میکند تا بتوان آنها را بررسی کرد، نه اینکه به یک جعبه سیاه میانگین تبدیل شوند. تحقیقات در مورد Mixture-of-Agents (arXiv:2406.04692) نشان میدهد که لایهبندی چندین مدل زبان بزرگ به افزایش کیفیت منجر میشود، که عمدتاً بر اساس معیارهای ترجیحی مانند AlpacaEval اندازهگیری میشود—شواهدی از بهبود کیفیت پاسخ، نه تضمینی از دقت واقعی در هر ادعای خاص. Argumentree.AI اجماع را به عنوان یک سیگنال اعتماد در نظر میگیرد، نه یک اوراکل حقیقت؛ اختلافات بین مدلها اغلب قابل اقدامترین خروجی هستند.
اجماع چندین مدل زبان بزرگ توافقی است که در میان چندین مدل واقعاً متفاوت به دست میآید—نه یک مدل که دو بار نمونهبرداری شده و نه یک میانگین ترکیبی. این یک سیگنال اعتماد است که میتوانید بررسی کنید، نه یک اوراکل حقیقت.
اجماع چندین مدل زبان بزرگ توافق را در میان چندین مدل مختلف اندازهگیری میکند. این با خودسازگاری (یک مدل، چندین نمونه) و ترکیب آماری (میانگین ترکیبی) متفاوت است. این استدلالهای فردی را حفظ میکند—و این یک سیگنال اعتماد، نه اثبات حقیقت است.
اجماع چندین مدل زبان بزرگ درجه توافقی است که زمانی به دست میآید که چندین مدل زبان بزرگ مختلف به طور مستقل درباره یک سوال استدلال کنند و استدلالهای یکدیگر را ارزیابی کنند. کلمهای که مهم است مختلف است: مدلها از معماریها و دادههای آموزشی متفاوتی میآیند، بنابراین وقتی به توافق میرسند، آن توافق بیشتر از یک دیدگاه سیستم واحد را منعکس میکند—و وقتی که اختلاف دارند، این تقسیم نشاندهنده یک ادعای واقعی مورد مناقشه است.
یک تکنیک رایج مدل تک خودسازگاری است: نمونهبرداری از همان مدل چندین بار و گرفتن پاسخ اکثریت. این تنوع تصادفی را کاهش میدهد، اما هر نمونه تعصبات و نقاط کور همان مدل را به ارث میبرد. اگر مدل به طور مطمئن اشتباه باشد، نمونهبرداری مجدد از آن فقط خطا را تکرار میکند. اجماع چندین مدل زبان بزرگ از نظر نوع متفاوت است—این به مدلهای مستقل تکیه میکند، بنابراین یک نقطه کور مشترک در یکی به احتمال زیاد در همه مشترک نیست.
ترکیب کلاسیک خروجیهای مدل را به یک پیشبینی میانگین ترکیب میکند—برای نمره مفید است، برای درک بیفایده. اجماع چندین مدل زبان بزرگ به عمد برعکس عمل میکند: این استدلالهای فردی را حفظ میکند تا بتوانید استدلال هر مدل را بخوانید. هیچ چیزی به یک عدد جعبه سیاه تبدیل نمیشود. این چیزی است که باعث میشود اختلاف قابل درک باشد به جای اینکه در یک میانگین ناپدید شود.
| رویکرد | چه چیزی را ترکیب میکند | استدلال قابل مشاهده است؟ |
|---|---|---|
| خودسازگاری | یک مدل، چندین نمونه | فقط پاسخ اکثریت |
| ترکیب آماری | خروجیها به یک میانگین ترکیب شدهاند | خیر—به میانگین تبدیل شده |
| اجماع چندین مدل زبان بزرگ | استدلالهای چندین مدل مختلف | بله—حفظ شده و قابل بررسی |
تحقیقات غالباً به اینجا استناد میشود Mixture-of-Agents (arXiv:2406.04692)، که چندین مدل زبان بزرگ را لایهبندی میکند تا لایههای بعدی پاسخهای قبلی را تصحیح کنند. این گزارش افزایش کیفیت را ارائه میدهد—اما مهم است که دقیق باشید که چه چیزی اندازهگیری شده است.
افزایشهای Mixture-of-Agents عمدتاً در معیارهای ترجیحی مانند AlpacaEval نشان داده شده است—معیارهایی برای قضاوت در مورد کیفیت یک پاسخ. این تضمینی از دقت واقعی در هر ادعای خاص نیست. ترکیب مدلها میتواند کیفیت را بهبود بخشد؛ اما حقیقت را تأیید نمیکند.
قطعات را کنار هم بگذارید و چارچوب صادقانه این است: اجماع چندین مدل زبان بزرگ یک سیگنال اعتماد است. اجماع بالا به این معنی است که چندین سیستم مستقل توافق دارند، که اولویت برای تأیید انسانی را کاهش میدهد—اما آن را از بین نمیبرد. مدلها میتوانند یک تعصب آموزشی مشترک داشته باشند و به طور مشترک اشتباه کنند. اجماع را به عنوان "احتمالاً ریسک کمتری" در نظر بگیرید و اختلافات را به عنوان قابل اقدامترین خروجی خود در نظر بگیرید: آنها دقیقاً به جایی اشاره میکنند که تأیید مهمترین است.
اجماع در میان سیستمهای متمایز—نه یک مدل که دوباره نمونهبرداری شده
هر استدلال مدل را بخوانید؛ هیچ چیزی به یک جعبه سیاه میانگین تبدیل نمیشود
نمرات اعتماد را کالیبره میکنند—هرگز به عنوان اثبات حقیقت ارائه نمیشوند
نقاط مورد مناقشه برای تأیید انسانی علامتگذاری میشوند
اجماع چندین مدل زبان بزرگ سطح توافقی است که زمانی به دست میآید که چندین مدل زبان بزرگ مختلف به طور مستقل درباره یک ادعا استدلال کنند و استدلالهای یکدیگر را ارزیابی کنند. برخلاف نمونهبرداری از یک مدل چندین بار، این به طور واقعی از سیستمهای مختلف استفاده میکند—بنابراین اجماع توافق را در میان معماریها و دادههای آموزشی متمایز منعکس میکند و اختلافات جایی را که یک ادعا مورد مناقشه است، علامتگذاری میکند.
خودسازگاری همان مدل واحد را چندین بار نمونهبرداری میکند و پاسخ اکثریت را میگیرد. این تنوع تصادفی را کاهش میدهد اما تعصبات و نقاط کور یک مدل را به اشتراک میگذارد. اجماع چندین مدل زبان بزرگ از مدلهای مختلف استفاده میکند، بنابراین توافق معنادارتر است و اختلاف میتواند یک نقطه کور را نشان دهد که نمونهبرداری مکرر از یک مدل هرگز آن را فاش نمیکند.
ترکیب آماری خروجیهای مدل را به یک پیشبینی میانگین ترکیب میکند و استدلالهای فردی را کنار میگذارد. اجماع چندین مدل زبان بزرگ استدلالهای هر مدل را حفظ میکند تا بتوانید آنها را بخوانید. هیچ چیزی به یک نمره جعبه سیاه میانگین تبدیل نمیشود که نمیتوانید بررسی کنید—موارد فردی قابل مشاهده باقی میمانند، که این چیزی است که باعث میشود اختلاف قابل درک باشد.
تحقیقات مانند Mixture-of-Agents (arXiv:2406.04692) نشان میدهد که لایهبندی چندین مدل زبان بزرگ به افزایش کیفیت منجر میشود، که عمدتاً بر اساس معیارهای ترجیحی مانند AlpacaEval اندازهگیری میشود. این شواهدی از بهبود کیفیت پاسخ در آن معیارها است—این تضمینی از دقت واقعی در هر ادعای خاص نیست. اجماع را به عنوان یک سیگنال اعتماد در نظر بگیرید، نه یک اوراکل حقیقت.
خیر. اجماع یک سیگنال اعتماد است، نه اثبات. چندین مدل میتوانند تعصب آموزشی یکسانی داشته باشند و بر روی چیزی نادرست توافق کنند. اجماع بالا اولویت برای تأیید انسانی را کاهش میدهد؛ اما هرگز نیاز به آن را از بین نمیبرد. قابل اقدامترین خروجی اغلب اختلاف است، که به جایی اشاره میکند که تأیید مهمترین است.
نه یک مدل که دو بار نمونهبرداری شده. چندین مدل مختلف، استدلالها حفظ شده، اختلافات قابل مشاهده.
شروع رایگان