اجماع چندین مدل زبان بزرگ چیست؟

اجماع چندین مدل زبان بزرگ سطح توافقی است که زمانی به دست می‌آید که چندین مدل زبان بزرگ مختلف به طور مستقل درباره یک ادعا استدلال کنند و استدلال‌های یکدیگر را ارزیابی کنند. این با نمونه‌برداری از یک مدل یا خودسازگاری متفاوت است، که به طور مکرر یک مدل را نمونه‌برداری می‌کند و تعصبات آن مدل را به اشتراک می‌گذارد. همچنین با ترکیب آماری متفاوت است، که خروجی‌ها را به یک پیش‌بینی میانگین ترکیب می‌کند: اجماع چندین مدل زبان بزرگ استدلال‌های فردی را حفظ می‌کند تا بتوان آنها را بررسی کرد، نه اینکه به یک جعبه سیاه میانگین تبدیل شوند. تحقیقات در مورد Mixture-of-Agents (arXiv:2406.04692) نشان می‌دهد که لایه‌بندی چندین مدل زبان بزرگ به افزایش کیفیت منجر می‌شود، که عمدتاً بر اساس معیارهای ترجیحی مانند AlpacaEval اندازه‌گیری می‌شود—شواهدی از بهبود کیفیت پاسخ، نه تضمینی از دقت واقعی در هر ادعای خاص. Argumentree.AI اجماع را به عنوان یک سیگنال اعتماد در نظر می‌گیرد، نه یک اوراکل حقیقت؛ اختلافات بین مدل‌ها اغلب قابل اقدام‌ترین خروجی هستند.

بازگشت به هوش جمعی AIتحقیقات چندین AI

اجماع چندین مدل زبان بزرگ چیست
اجماع چندین مدل زبان بزرگ؟

اجماع چندین مدل زبان بزرگ توافقی است که در میان چندین مدل واقعاً متفاوت به دست می‌آید—نه یک مدل که دو بار نمونه‌برداری شده و نه یک میانگین ترکیبی. این یک سیگنال اعتماد است که می‌توانید بررسی کنید، نه یک اوراکل حقیقت.

خلاصه

اجماع چندین مدل زبان بزرگ توافق را در میان چندین مدل مختلف اندازه‌گیری می‌کند. این با خودسازگاری (یک مدل، چندین نمونه) و ترکیب آماری (میانگین ترکیبی) متفاوت است. این استدلال‌های فردی را حفظ می‌کند—و این یک سیگنال اعتماد، نه اثبات حقیقت است.

تعریف اجماع چندین مدل زبان بزرگ

اجماع چندین مدل زبان بزرگ درجه توافقی است که زمانی به دست می‌آید که چندین مدل زبان بزرگ مختلف به طور مستقل درباره یک سوال استدلال کنند و استدلال‌های یکدیگر را ارزیابی کنند. کلمه‌ای که مهم است مختلف است: مدل‌ها از معماری‌ها و داده‌های آموزشی متفاوتی می‌آیند، بنابراین وقتی به توافق می‌رسند، آن توافق بیشتر از یک دیدگاه سیستم واحد را منعکس می‌کند—و وقتی که اختلاف دارند، این تقسیم نشان‌دهنده یک ادعای واقعی مورد مناقشه است.

نه همانند خودسازگاری

یک تکنیک رایج مدل تک خودسازگاری است: نمونه‌برداری از همان مدل چندین بار و گرفتن پاسخ اکثریت. این تنوع تصادفی را کاهش می‌دهد، اما هر نمونه تعصبات و نقاط کور همان مدل را به ارث می‌برد. اگر مدل به طور مطمئن اشتباه باشد، نمونه‌برداری مجدد از آن فقط خطا را تکرار می‌کند. اجماع چندین مدل زبان بزرگ از نظر نوع متفاوت است—این به مدل‌های مستقل تکیه می‌کند، بنابراین یک نقطه کور مشترک در یکی به احتمال زیاد در همه مشترک نیست.

نه همانند ترکیب آماری

ترکیب کلاسیک خروجی‌های مدل را به یک پیش‌بینی میانگین ترکیب می‌کند—برای نمره مفید است، برای درک بی‌فایده. اجماع چندین مدل زبان بزرگ به عمد برعکس عمل می‌کند: این استدلال‌های فردی را حفظ می‌کند تا بتوانید استدلال هر مدل را بخوانید. هیچ چیزی به یک عدد جعبه سیاه تبدیل نمی‌شود. این چیزی است که باعث می‌شود اختلاف قابل درک باشد به جای اینکه در یک میانگین ناپدید شود.

رویکردچه چیزی را ترکیب می‌کنداستدلال قابل مشاهده است؟
خودسازگارییک مدل، چندین نمونهفقط پاسخ اکثریت
ترکیب آماریخروجی‌ها به یک میانگین ترکیب شده‌اندخیر—به میانگین تبدیل شده
اجماع چندین مدل زبان بزرگاستدلال‌های چندین مدل مختلفبله—حفظ شده و قابل بررسی

آنچه تحقیقات واقعاً نشان می‌دهد

تحقیقات غالباً به اینجا استناد می‌شود Mixture-of-Agents (arXiv:2406.04692)، که چندین مدل زبان بزرگ را لایه‌بندی می‌کند تا لایه‌های بعدی پاسخ‌های قبلی را تصحیح کنند. این گزارش افزایش کیفیت را ارائه می‌دهد—اما مهم است که دقیق باشید که چه چیزی اندازه‌گیری شده است.

ادعا را با دقت بخوانید

افزایش‌های Mixture-of-Agents عمدتاً در معیارهای ترجیحی مانند AlpacaEval نشان داده شده است—معیارهایی برای قضاوت در مورد کیفیت یک پاسخ. این تضمینی از دقت واقعی در هر ادعای خاص نیست. ترکیب مدل‌ها می‌تواند کیفیت را بهبود بخشد؛ اما حقیقت را تأیید نمی‌کند.

یک سیگنال اعتماد، نه یک اوراکل حقیقت

قطعات را کنار هم بگذارید و چارچوب صادقانه این است: اجماع چندین مدل زبان بزرگ یک سیگنال اعتماد است. اجماع بالا به این معنی است که چندین سیستم مستقل توافق دارند، که اولویت برای تأیید انسانی را کاهش می‌دهد—اما آن را از بین نمی‌برد. مدل‌ها می‌توانند یک تعصب آموزشی مشترک داشته باشند و به طور مشترک اشتباه کنند. اجماع را به عنوان "احتمالاً ریسک کمتری" در نظر بگیرید و اختلافات را به عنوان قابل اقدام‌ترین خروجی خود در نظر بگیرید: آنها دقیقاً به جایی اشاره می‌کنند که تأیید مهم‌ترین است.

اجماع چندین مدل زبان بزرگ با Argumentree.AI

چندین مدل مختلف

اجماع در میان سیستم‌های متمایز—نه یک مدل که دوباره نمونه‌برداری شده

استدلال‌ها حفظ شده

هر استدلال مدل را بخوانید؛ هیچ چیزی به یک جعبه سیاه میانگین تبدیل نمی‌شود

اجماع به عنوان سیگنال

نمرات اعتماد را کالیبره می‌کنند—هرگز به عنوان اثبات حقیقت ارائه نمی‌شوند

اختلافات نمایان شده

نقاط مورد مناقشه برای تأیید انسانی علامت‌گذاری می‌شوند

سوالات متداول

اجماع چندین مدل زبان بزرگ چیست؟

اجماع چندین مدل زبان بزرگ سطح توافقی است که زمانی به دست می‌آید که چندین مدل زبان بزرگ مختلف به طور مستقل درباره یک ادعا استدلال کنند و استدلال‌های یکدیگر را ارزیابی کنند. برخلاف نمونه‌برداری از یک مدل چندین بار، این به طور واقعی از سیستم‌های مختلف استفاده می‌کند—بنابراین اجماع توافق را در میان معماری‌ها و داده‌های آموزشی متمایز منعکس می‌کند و اختلافات جایی را که یک ادعا مورد مناقشه است، علامت‌گذاری می‌کند.

اجماع چندین مدل زبان بزرگ چگونه با خودسازگاری متفاوت است؟

خودسازگاری همان مدل واحد را چندین بار نمونه‌برداری می‌کند و پاسخ اکثریت را می‌گیرد. این تنوع تصادفی را کاهش می‌دهد اما تعصبات و نقاط کور یک مدل را به اشتراک می‌گذارد. اجماع چندین مدل زبان بزرگ از مدل‌های مختلف استفاده می‌کند، بنابراین توافق معنادارتر است و اختلاف می‌تواند یک نقطه کور را نشان دهد که نمونه‌برداری مکرر از یک مدل هرگز آن را فاش نمی‌کند.

این چگونه با ترکیب آماری متفاوت است؟

ترکیب آماری خروجی‌های مدل را به یک پیش‌بینی میانگین ترکیب می‌کند و استدلال‌های فردی را کنار می‌گذارد. اجماع چندین مدل زبان بزرگ استدلال‌های هر مدل را حفظ می‌کند تا بتوانید آنها را بخوانید. هیچ چیزی به یک نمره جعبه سیاه میانگین تبدیل نمی‌شود که نمی‌توانید بررسی کنید—موارد فردی قابل مشاهده باقی می‌مانند، که این چیزی است که باعث می‌شود اختلاف قابل درک باشد.

آیا تحقیقات اثبات می‌کند که ترکیب مدل‌ها دقت را بهبود می‌بخشد؟

تحقیقات مانند Mixture-of-Agents (arXiv:2406.04692) نشان می‌دهد که لایه‌بندی چندین مدل زبان بزرگ به افزایش کیفیت منجر می‌شود، که عمدتاً بر اساس معیارهای ترجیحی مانند AlpacaEval اندازه‌گیری می‌شود. این شواهدی از بهبود کیفیت پاسخ در آن معیارها است—این تضمینی از دقت واقعی در هر ادعای خاص نیست. اجماع را به عنوان یک سیگنال اعتماد در نظر بگیرید، نه یک اوراکل حقیقت.

آیا اجماع بالا به این معنی است که یک پاسخ درست است؟

خیر. اجماع یک سیگنال اعتماد است، نه اثبات. چندین مدل می‌توانند تعصب آموزشی یکسانی داشته باشند و بر روی چیزی نادرست توافق کنند. اجماع بالا اولویت برای تأیید انسانی را کاهش می‌دهد؛ اما هرگز نیاز به آن را از بین نمی‌برد. قابل اقدام‌ترین خروجی اغلب اختلاف است، که به جایی اشاره می‌کند که تأیید مهم‌ترین است.

اجماع را در میان مدل‌های واقعی اندازه‌گیری کنید

نه یک مدل که دو بار نمونه‌برداری شده. چندین مدل مختلف، استدلال‌ها حفظ شده، اختلافات قابل مشاهده.

شروع رایگان