এআই পিয়ার রিভিউ হল একাধিক এআই মডেলকে একে অপরের যুক্তি পর্যালোচনা এবং মূল্যায়ন করার প্রক্রিয়া, ঠিক যেমন একাডেমিক পিয়ার রিভিউ এআই আউটপুটে প্রয়োগ করা হয়। একটি একক মডেলের উত্তরকে বিশ্বাস করার পরিবর্তে, প্রতিটি মডেলের দাবি অন্য মডেলগুলির দ্বারা মূল্যায়ন করা হয়, এবং ক্রস-মডেল পর্যালোচনার মাধ্যমে টিকে থাকা যুক্তিগুলি আত্মবিশ্বাস অর্জন করে। যুক্তির ভিত্তি হল একটি একক এলএলএমকে বিচারক হিসাবে ব্যবহার করার পরিচিত সীমাবদ্ধতা: গবেষণাপত্রগুলি অবস্থান পক্ষপাত (যে উত্তরটি প্রথমে প্রদর্শিত হয় সেটিকে পছন্দ করা), verbosity পক্ষপাত (গুণমান নির্বিশেষে দীর্ঘ উত্তরকে পুরস্কৃত করা), এবং স্ব-উন্নয়ন পক্ষপাত (একটি মডেল তার নিজস্ব আউটপুটকে পছন্দ করে)। একাধিক মডেলের মধ্যে মূল্যায়ন ছড়িয়ে দেওয়া এবং কোন যুক্তি মূল্যায়ন করা হচ্ছে তা অ্যানোনিমাইজ করা যে কোনও এক বিচারকের অদ্ভুত পক্ষপাতকে দুর্বল করে। কারণ বিভিন্ন মডেল ভিন্নভাবে হ্যালুসিনেট করতে প্রবণ, একটি তৈরি বা সমর্থিত দাবি প্রায়ই অন্য মডেলগুলির দ্বারা খারাপভাবে মূল্যায়িত হয়, তাই ধারাবাহিকভাবে নিম্ন ক্রস-মডেল রেটিংগুলি এমন দাবিগুলিকে চিহ্নিত করে যা মানব যাচাইয়ের প্রয়োজন। Argumentree.AI এটি বাস্তবায়ন করে প্রতিটি উপলব্ধ মডেলকে অন্য মডেলের যুক্তিগুলি অ্যানোনিমাসভাবে মূল্যায়ন করতে দেয়, কোন দাবিগুলি ব্যাপকভাবে সমর্থিত এবং কোনগুলি দুর্বল বা বিতর্কিত তা প্রকাশ করে। এটি মানব বিচারকে বাড়িয়ে তোলে, প্রতিস্থাপন করে না।
এআই পিয়ার রিভিউতে একাধিক মডেল একে অপরের যুক্তি মূল্যায়ন করে — একাডেমিক পিয়ার রিভিউ, এআই আউটপুটে প্রয়োগ করা। অ্যানোনিমাইজড ক্রস-মডেল রেটিং একটি একক এআই বিচারককে পরাজিত করে, যার রেটিং পক্ষপাতদুষ্ট বলে পরিচিত।
এআই পিয়ার রিভিউ মডেলগুলিকে একে অপরের যুক্তি মূল্যায়ন করতে বাধ্য করে, একটি বিচারককে বিশ্বাস করার পরিবর্তে। একক এলএলএম বিচারকরা অবস্থান, verbosity, এবং স্ব-উন্নয়ন পক্ষপাত প্রদর্শন করে — একাধিক মডেলের মধ্যে রেটিং ছড়িয়ে দেওয়া, অ্যানোনিমাসভাবে, সেই পক্ষপাতগুলিকে দুর্বল করে এবং দুর্বল বা হ্যালুসিনেটেড দাবিগুলিকে প্রকাশ করে।
একাডেমিয়ায়, একটি দাবি গ্রহণ করা হয় না কারণ এর লেখক আত্মবিশ্বাসী — এটি স্বাধীন সহকর্মীদের দ্বারা পর্যালোচনা করা হয় যারা যুক্তি এবং প্রমাণ মূল্যায়ন করে। এআই পিয়ার রিভিউ সেই নীতিটি ধার করে: একটি মডেলের উত্তরকে বিশ্বাস করার পরিবর্তে, আপনার কাছে একাধিক মডেল রয়েছে যা একে অপরের যুক্তি পর্যালোচনা এবং মূল্যায়ন করে। ক্রস-মডেল পর্যালোচনার অধীনে টিকে থাকা দাবিগুলি আত্মবিশ্বাস অর্জন করে; অন্য মডেলগুলি যেগুলি খারাপভাবে মূল্যায়ন করে সেগুলি চিহ্নিত হয়।
একটি প্রলুব্ধকর শর্টকাট হল একটি একক শক্তিশালী মডেলকে আউটপুটগুলি গ্রেড করতে দেওয়া — "এলএলএম-এ-একটি-বিচারক" প্যাটার্ন। সমস্যা: এলএলএম বিচারকদের উপর গবেষণায় এমন সিস্টেম্যাটিক পক্ষপাত নথিভুক্ত হয়েছে যা একটি বিচারককে অরক্ষিত করে তোলে।
এই পক্ষপাতগুলির বিরুদ্ধে দুটি ডিজাইন পছন্দ: অনেক মডেলের মধ্যে রেটিং ছড়িয়ে দিন, এবং কোন যুক্তি মূল্যায়ন করা হচ্ছে তা অ্যানোনিমাইজ করুন। একসাথে তারা বিষয়বস্তু বিচার করে, লেখক নয়, এবং একটি একক মডেলের অদ্ভুততাগুলিকে গড়ে তোলে।
প্রতিটি উপলব্ধ মডেল স্বাধীনভাবে পক্ষে/বিপক্ষে যুক্তি প্রদান করে।
যুক্তিগুলি অ্যানোনিমাইজ করা হয় যাতে কোন মডেল জানে না কোনটি তার নিজস্ব।
রেটিংগুলি মডেলগুলির মধ্যে ছড়িয়ে পড়ে, একটি বিচারকের মধ্যে কেন্দ্রীভূত হয় না।
বিস্তৃত সমর্থন = আত্মবিশ্বাস; ধারাবাহিকভাবে নিম্ন রেটিং = একটি দুর্বল বা হ্যালুসিনেটেড দাবি যাচাই করার জন্য।
একটি মডেল দাবি করে "এই লাইব্রেরিটি ডিজাইনের দ্বারা মেমরি-নিরাপদ" একটি আত্মবিশ্বাসী উদ্ধৃতির সাথে। অ্যানোনিমাইজড পিয়ার রিভিউয়ের অধীনে, অন্যান্য মডেল সেই যুক্তিকে নিম্ন রেটিং দেয় — কয়েকটি উল্লেখ করে যে উদ্ধৃত গ্যারান্টিটি অ-নিরাপদ ইন্টারঅপ পাথকে কভার করে না। নিম্ন ক্রস-মডেল রেটিংটি দাবিটিকে একটি মানব দ্বারা পরীক্ষা করার জন্য চিহ্নিত করে, একটি আত্মবিশ্বাসী মডেলকে চ্যালেঞ্জ ছাড়াই এগিয়ে যেতে না দিয়ে।
প্রতিটি উপলব্ধ মডেল প্রতিটি অন্য মডেলের যুক্তি মূল্যায়ন করে — অ্যানোনিমাস — যাতে দুর্বল দাবিগুলি একটি মডেলের আত্মবিশ্বাসের পিছনে লুকাতে না পারে।
যুক্তিগুলি একাধিক মডেল থেকে আসে, একটি একক উৎস থেকে নয়
প্রতিটি মডেল লেখক জানার ছাড়াই প্রতিটি অন্য মডেলের যুক্তি মূল্যায়ন করে
বিস্তৃতভাবে সমর্থিত যুক্তিগুলি বাড়ে; ধারাবাহিকভাবে নিম্ন রেট করা যুক্তিগুলি চিহ্নিত হয়
সম্ভাব্য হ্যালুসিনেশনগুলি যাচাই করার জন্য ক্রস-মডেল অমিল হিসাবে প্রদর্শিত হয়
এআই পিয়ার রিভিউ হল যখন একাধিক এআই মডেল একে অপরের যুক্তি পর্যালোচনা এবং মূল্যায়ন করে, ঠিক যেমন একাডেমিক পিয়ার রিভিউ এআই আউটপুটে প্রয়োগ করা হয়। একটি একক মডেলের উত্তরকে বিশ্বাস করার পরিবর্তে, প্রতিটি মডেলের দাবি অন্য মডেলগুলির দ্বারা মূল্যায়ন করা হয়। ক্রস-মডেল পর্যালোচনার অধীনে টিকে থাকা যুক্তিগুলি আত্মবিশ্বাস অর্জন করে; অন্য মডেলগুলি যেগুলি খারাপভাবে মূল্যায়ন করে সেগুলি দুর্বল বা সম্ভাব্য হ্যালুসিনেটেড হিসাবে চিহ্নিত হয়।
একটি এলএলএমকে বিচারক হিসাবে ব্যবহার করা পক্ষপাতদুষ্ট বলে পরিচিত। এলএলএম-এ-একটি-বিচারক গবেষণায় অবস্থান পক্ষপাত (যে উত্তরটি প্রথমে প্রদর্শিত হয় সেটিকে পছন্দ করা), verbosity পক্ষপাত (গুণমান নির্বিশেষে দীর্ঘ উত্তরকে পুরস্কৃত করা), এবং স্ব-উন্নয়ন পক্ষপাত (একটি মডেল তার নিজস্ব আউটপুটকে পছন্দ করে) নথিভুক্ত করা হয়েছে। একাধিক মডেলের মধ্যে মূল্যায়ন ছড়িয়ে দেওয়া এবং কোন যুক্তি মূল্যায়ন করা হচ্ছে তা অ্যানোনিমাইজ করা যে কোনও এক বিচারকের অদ্ভুত পক্ষপাতকে দুর্বল করে।
যদি একটি মডেল জানে কোন যুক্তি তার নিজস্ব, স্ব-উন্নয়ন পক্ষপাত এটি নিজেকে উচ্চতর রেট করতে বাধ্য করতে পারে। রেটিংয়ের আগে যুক্তিগুলি অ্যানোনিমাইজ করা সেই সংকেতটি মুছে দেয়, তাই প্রতিটি মডেল বিষয়বস্তু বিচার করে লেখক নয়। একাধিক মডেলের রেটিং একত্রিত করা আরও একটি একক মডেলের অবস্থান বা verbosity অদ্ভুততাগুলিকে গড়ে তোলে, একটি একক বিচারকের চেয়ে আরও ভারসাম্যপূর্ণ সংকেত তৈরি করে।
এটি সেগুলি প্রকাশ করতে সাহায্য করে। কারণ বিভিন্ন মডেল ভিন্নভাবে হ্যালুসিনেট করতে প্রবণ, একটি মডেল থেকে তৈরি বা সমর্থিত দাবি প্রায়ই অন্যদের দ্বারা খারাপভাবে মূল্যায়িত হয়। ধারাবাহিকভাবে নিম্ন ক্রস-মডেল রেটিংগুলি একটি লাল পতাকা যে একটি দাবি মানব যাচাইয়ের প্রয়োজন। এটি একটি অমিল-সনাক্তকরণ সংকেত, গ্যারান্টি নয় — যদি প্রতিটি মডেল একই ত্রুটি শেয়ার করে, পিয়ার রিভিউ এটি ধরবে না।
না। এআই পিয়ার রিভিউ মানব বিচারকে অগ্রাধিকার দেওয়ার এবং বাড়ানোর জন্য ডিজাইন করা হয়েছে, প্রতিস্থাপন করার জন্য নয়। এটি আপনাকে বলে কোন দাবিগুলি মডেলগুলির মধ্যে ব্যাপকভাবে সমর্থিত এবং কোনগুলি বিতর্কিত বা দুর্বল, যাতে মানুষ তাদের যাচাইয়ের উপর মনোনিবেশ করতে পারে যেখানে এটি সবচেয়ে গুরুত্বপূর্ণ। চূড়ান্ত সিদ্ধান্ত এবং উচ্চ-ঝুঁকির যাচাই মানব দায়িত্ব রয়ে যায়।
একটি এআই বিচারককে বিশ্বাস করবেন না। দেখুন কিভাবে প্রতিটি মডেল প্রতিটি অন্য মডেলের যুক্তি মূল্যায়ন করে।
ফ্রি শুরু করুন