Dewan LLM adalah sekelompok model bahasa besar yang masing-masing menjawab pertanyaan secara independen, kemudian saling menilai jawaban satu sama lain untuk mencapai konsensus. Pola ini dipopulerkan oleh repositori open-source 'llm-council' milik Andrej Karpathy, sebuah bukti konsep di mana beberapa model menjawab dan kemudian memberi peringkat satu sama lain sebelum sintesis akhir. Argumentree.AI memperluas pola dewan dengan pohon argumen terstruktur dan penilaian mutual anonim—anonim karena penelitian tentang penggunaan LLM sebagai juri mendokumentasikan bias peningkatan diri di mana model lebih menyukai keluaran mereka sendiri. Dewan LLM yang dihosting memungkinkan Anda untuk mengajukan pertanyaan kepada beberapa model tanpa menyediakan kunci API Anda sendiri. Pertukaran yang jujur adalah biaya dan latensi: dewan membuat beberapa panggilan model, sehingga lebih lambat dan lebih mahal daripada satu kueri, sebagai imbalan untuk validasi lintas model dan ketidaksepakatan yang terlihat.
Sebuah dewan LLM memiliki beberapa model bahasa yang menjawab secara independen, saling menilai, dan mencapai konsensus. Ini mengubah "satu jawaban yang percaya diri" menjadi deliberasi yang dapat Anda periksa.
Sebuah dewan LLM adalah beberapa model yang menjawab secara independen, kemudian saling menilai untuk membentuk konsensus. Pola ini berasal dari llm-council open-source milik Karpathy. Argumentree.AI menghostingnya—tanpa kunci API yang diperlukan—dan menilai secara anonim untuk mengurangi pujian diri.
Pola dewan mudah dinyatakan: beberapa LLM menjawab pertanyaan yang sama secara independen, kemudian mengevaluasi jawaban satu sama lain, dan konsensus ditarik dari penilaian rekan. Tidak ada model tunggal yang mendapatkan kata terakhir. Karena model tidak melihat respons satu sama lain sebelum menjawab, penalaran independen mereka terjaga—dan tempat di mana mereka berbeda menjadi terlihat alih-alih tersembunyi di balik satu jawaban yang percaya diri.
Setiap model menjawab pertanyaan sendiri, tanpa melihat yang lain
Setiap model mengevaluasi jawaban model lain
Penilaian digabungkan untuk mengungkap di mana dewan setuju dan tidak setuju
Andrej Karpathy menerbitkan repositori open-source "llm-council" yang menunjukkan alur ini—beberapa model menjawab, memberi peringkat satu sama lain, dan respons akhir disintesis. Ini adalah bukti publik bahwa model dapat secara bermakna mengevaluasi satu sama lain. Argumentree.AI membangun ide yang sama.
Argumentree.AI membawa pola dewan lebih jauh dalam dua cara. Pertama, alih-alih membandingkan jawaban secara keseluruhan, ia menyusun penalaran setiap model menjadi pohon argumen—sehingga klaim individu dapat dinilai dan diperiksa, bukan hanya paragraf akhir. Kedua, ia menggunakan penilaian mutual anonim: ketika sebuah model menilai argumen, ia tidak tahu model mana yang membuatnya.
Penelitian tentang penggunaan LLM sebagai juri mendokumentasikan bias peningkatan diri—model cenderung menilai keluaran mereka sendiri lebih menguntungkan. Menyembunyikan kepemilikan sebelum penilaian menghilangkan jalan pintas, sehingga model tidak dapat sekadar memberi penghargaan pada dirinya sendiri. Itulah alasan desain untuk penilaian silang anonim.
Menjalankan dewan sendiri biasanya berarti mendaftar dengan setiap penyedia model dan menghubungkan kunci API terpisah. Argumentree.AI menawarkan dewan LLM yang dihosting: Anda bertanya sekali, dan semua model yang tersedia berpartisipasi—tanpa kunci yang harus dikelola, tanpa pengaturan per penyedia. Anda mendapatkan konsensus dewan dan ketidaksepakatan dalam satu tempat.
Sebuah dewan tidak gratis. Secara definisi, ia membuat beberapa panggilan model, sehingga menggunakan lebih banyak komputasi dan memerlukan waktu lebih lama untuk kembali daripada satu kueri. Itulah pertukaran yang disengaja: Anda mengeluarkan lebih banyak untuk mendapatkan validasi lintas model dan peta ketidaksepakatan yang terlihat. Untuk penelitian berisiko tinggi, itu adalah kesepakatan yang baik; untuk pencarian sepele, satu model sudah cukup.
Mengumpulkan dewan beberapa model dengan satu pertanyaan
Periksa penalaran setiap model poin demi poin, bukan sebagai satu kesatuan
Penilaian silang menyembunyikan kepemilikan untuk mengurangi bias peningkatan diri
Tanpa kunci API per penyedia—konsensus dan ketidaksepakatan langsung tersedia
Dewan LLM adalah sekelompok model bahasa besar yang masing-masing menjawab pertanyaan secara independen, kemudian saling menilai jawaban satu sama lain untuk menghasilkan pandangan konsensus. Alih-alih bergantung pada satu model, dewan membuat kesepakatan dan ketidaksepakatan antara model menjadi eksplisit—sehingga Anda dapat melihat di mana model-model tersebut bersatu dan di mana tidak.
Andrej Karpathy merilis repositori open-source 'llm-council' yang menunjukkan pola ini: beberapa model menjawab sebuah kueri, kemudian memberi peringkat jawaban satu sama lain sebelum sintesis akhir. Ini adalah bukti konsep dari penalaran kolektif di antara model. Argumentree.AI memperluas ide ini dengan pohon argumen terstruktur dan penilaian mutual anonim.
Penelitian tentang penggunaan LLM sebagai juri telah mendokumentasikan bias peningkatan diri—model cenderung lebih menyukai keluaran mereka sendiri. Menyembunyikan model mana yang menghasilkan argumen sebelum penilaian mengurangi bias tersebut, sehingga model tidak dapat sekadar memberi penghargaan pada dirinya sendiri. Ini adalah alasan desain di balik penilaian silang anonim Argumentree.AI.
Tidak dengan dewan LLM yang dihosting. Implementasi open-source biasanya mengharuskan Anda untuk menyediakan kunci API untuk setiap penyedia. Argumentree.AI menawarkan dewan multi-LLM yang dihosting sehingga Anda dapat mengajukan beberapa model dan melihat konsensus mereka tanpa menghubungkan kunci API individu sendiri.
Sejujurnya, menjalankan dewan lebih mahal daripada satu kueri—ia membuat beberapa panggilan model, sehingga menggunakan lebih banyak komputasi dan memerlukan waktu lebih lama untuk kembali. Pertukaran itu memberi Anda validasi lintas model dan peta ketidaksepakatan yang terlihat. Untuk pertanyaan berisiko tinggi, biaya dan latensi tambahan biasanya sepadan; untuk pencarian sepele, satu model sudah cukup.
Beberapa model, satu pertanyaan, konsensus yang dapat Anda periksa—tanpa kunci API yang diperlukan.
Mulai Gratis