LLM 위원회는 각기 독립적으로 질문에 답변한 후 서로의 응답을 평가하여 합의에 도달하는 대규모 언어 모델 그룹입니다. 이 패턴은 Andrej Karpathy의 오픈 소스 'llm-council' 저장소에 의해 대중화되었으며, 여러 모델이 답변하고 서로를 평가한 후 최종 합성을 이루는 개념 증명입니다. Argumentree.AI는 구조화된 논증 트리와 익명 상호 평가로 위원회 패턴을 확장합니다. 익명화된 이유는 LLM을 판사로 사용하는 연구에서 모델이 자신의 출력을 선호하는 자기 향상 편향이 문서화되었기 때문입니다. 호스팅된 LLM 위원회를 통해 여러 모델에 API 키를 제공하지 않고도 쿼리할 수 있습니다. 정직한 거래는 비용과 지연입니다: 위원회는 여러 모델 호출을 하므로 단일 쿼리보다 느리고 비용이 더 많이 들지만, 교차 모델 검증과 가시적인 이견을 제공합니다.
여러 LLM 위원회는 여러 언어 모델이 독립적으로 답변하고 서로 평가하여 합의에 도달합니다. 이는 "하나의 확신 있는 답변"을 검토할 수 있는 심의로 바꿉니다.
LLM 위원회는 여러 모델이 독립적으로 답변한 후 서로를 평가하여 합의를 형성하는 것입니다. 이 패턴은 Karpathy의 오픈 소스 llm-council에서 유래되었습니다. Argumentree.AI가 이를 호스팅하며—API 키가 필요 없고—자기 과시를 억제하기 위해 익명으로 평가합니다.
위원회 패턴은 간단하게 설명할 수 있습니다: 여러 LLM이 동일한 질문에 독립적으로 답변한 후 서로의 답변을 평가하고, 동료 평가에서 합의가 도출됩니다. 단일 모델이 마지막 발언을 하지 않습니다. 모델들이 답변하기 전에 서로의 응답을 보지 않기 때문에 독립적인 추론이 보존되며, 그들이 다르게 답변하는 부분이 숨겨지지 않고 드러납니다.
모든 모델이 다른 모델을 보지 않고 질문에 답변합니다.
각 모델이 다른 모델의 답변을 평가합니다.
평가가 집계되어 위원회가 동의하고 이견이 있는 부분을 드러냅니다.
Andrej Karpathy는 이 흐름을 정확히 보여주는 오픈 소스 "llm-council" 저장소를 발표했습니다—여러 모델이 답변하고 서로를 평가한 후 최종 응답이 합성됩니다. 이는 모델들이 서로를 의미 있게 평가할 수 있다는 공개 증명입니다. Argumentree.AI는 같은 아이디어를 기반으로 합니다.
Argumentree.AI는 두 가지 방법으로 위원회 패턴을 더 발전시킵니다. 첫째, 전체 답변을 비교하는 대신 각 모델의 추론을 논증 트리로 구조화하여 개별 주장을 평가하고 검토할 수 있게 합니다. 둘째, 익명화된 상호 평가를 사용합니다: 모델이 주장을 평가할 때 어떤 모델이 그것을 작성했는지 모릅니다.
LLM을 판사로 사용하는 연구는 자기 향상 편향을 문서화했습니다—모델은 자신의 출력을 더 긍정적으로 평가하는 경향이 있습니다. 평가하기 전에 저자를 숨기면 단축키가 제거되어 모델이 스스로를 보상할 수 없습니다. 이것이 익명화된 교차 평가의 설계 근거입니다.
위원회를 직접 운영하는 것은 일반적으로 각 모델 제공업체에 가입하고 별도의 API 키를 연결해야 함을 의미합니다. Argumentree.AI는 호스팅된 LLM 위원회를 제공합니다: 한 번 요청하면 모든 사용 가능한 모델이 참여합니다—관리할 키가 없고, 제공업체별 설정이 필요 없습니다. 위원회의 합의와 이견을 한 곳에서 확인할 수 있습니다.
위원회는 무료가 아닙니다. 정의상 여러 모델 호출을 하므로 더 많은 컴퓨팅을 사용하고 단일 쿼리보다 더 오랜 시간이 걸립니다. 이것이 의도된 거래입니다: 교차 모델 검증과 이견의 가시적인 지도를 얻기 위해 더 많은 비용을 지출합니다. 고위험 연구에는 좋은 거래이지만, 사소한 조회에는 단일 모델이면 충분합니다.
단일 질문으로 여러 모델의 위원회를 소집합니다.
각 모델의 추론을 점검할 수 있습니다.
교차 평가는 저자를 숨겨 자기 향상 편향을 억제합니다.
제공업체별 API 키가 필요 없습니다—합의와 이견이 즉시 제공됩니다.
LLM 위원회는 각기 독립적으로 질문에 답변한 후 서로의 응답을 평가하여 합의된 관점을 생성하는 대규모 언어 모델 그룹입니다. 단일 모델에 의존하는 대신, 위원회는 모델 간의 동의와 이견을 명시적으로 드러내어 모델들이 수렴하는 지점과 그렇지 않은 지점을 볼 수 있게 합니다.
Andrej Karpathy는 패턴을 보여주는 오픈 소스 'llm-council' 저장소를 발표했습니다: 여러 모델이 쿼리에 답변한 후 서로의 답변을 평가하여 최종 합성을 이루는 것입니다. 이는 모델 간의 집단적 추론의 개념 증명입니다. Argumentree.AI는 구조화된 논증 트리와 익명화된 상호 평가로 이 아이디어를 확장합니다.
LLM을 판사로 사용하는 연구는 자기 향상 편향을 문서화했습니다—모델은 자신의 출력을 선호하는 경향이 있습니다. 평가하기 전에 어떤 모델이 어떤 주장을 작성했는지 익명화하면 그 편향이 줄어들어 모델이 스스로를 보상할 수 없습니다. 이것이 Argumentree.AI의 익명화된 교차 평가의 설계 근거입니다.
호스팅된 LLM 위원회에서는 필요하지 않습니다. 오픈 소스 구현은 일반적으로 각 제공업체에 대한 API 키를 제공해야 합니다. Argumentree.AI는 여러 모델에 쿼리하고 합의를 확인할 수 있는 호스팅된 다중 LLM 위원회를 제공합니다.
솔직히, 위원회를 운영하는 것은 단일 쿼리보다 더 많은 비용이 듭니다—여러 모델 호출을 하므로 더 많은 컴퓨팅을 사용하고 더 오랜 시간이 걸립니다. 이 거래는 교차 모델 검증과 이견의 가시적인 지도를 얻기 위해 이루어집니다. 고위험 질문에는 추가 비용과 지연이 보통 가치가 있지만, 사소한 조회에는 단일 모델이면 충분합니다.