HyperAIHyperAI

Command Palette

Search for a command to run...

인공 혼합지능: 언어 모델의 개방형 동질성(그 이상을 포함하여)

Liwei Jiang Yuanjun Chai Margaret Li Mickel Liu Raymond Fok Nouha Dziri Yulia Tsvetkov Maarten Sap Yejin Choi

초록

대규모 언어 모델(LM)은 종종 다양하고 인간과 유사한 창의적 콘텐츠를 생성하는 데 어려움을 겪으며, 이로 인해 반복적으로 유사한 출력에 노출됨으로써 인간 사고의 장기적 동질화에 대한 우려가 제기된다. 그러나 랜덤 숫자나 이름 생성과 같은 좁은 범위의 작업이나 단일 모델에서 반복 샘플링을 넘어서는 범위에서 LM 출력의 다양성을 평가할 수 있는 확장 가능한 방법은 여전히 제한적이다. 이러한 격차를 보완하기 위해, 우리는 실제 세계의 개방형 사용자 질의 26,000건으로 구성된 대규모 데이터셋인 Infinity-Chat을 소개한다. 이 데이터셋은 단일 정답이 없는 다양한 타당한 답변이 가능한 개방형 질문들로 구성되어 있으며, 실제 상황에서의 다양성을 반영한다. 또한, LM에 제시되는 개방형 프롬프트의 전반적인 스펙트럼을 체계적으로 특성화하기 위한 최초의 포괄적인 분류 체계를 제안한다. 이 분류 체계는 창의적 콘텐츠 생성, 브레인스토밍 및 아이디어 발굴 등 6개의 상위 카테고리로 구성되며, 이는 추가로 17개의 하위 카테고리로 세분화된다. Infinity-Chat을 활용하여, LM의 모드 붕괴(mode collapse) 현상을 대규모로 분석한 결과, 개방형 생성에서 두드러진 ‘인공적 혼합사고(artificial hivemind) 효과’가 확인되었다. 이는 (1) 모델 내 반복성, 즉 단일 모델이 일관되게 유사한 응답을 생성하는 현상과, 더 두드러진 (2) 모델 간 동질성, 즉 서로 다른 모델들이 놀랄 만큼 유사한 출력을 생성하는 현상으로 특징지어진다. Infinity-Chat은 각 예시당 25건의 독립적인 인간 평가를 포함하여 총 31,250건의 인간 주관적 평가(절대 평가 및 쌍별 선호 평가)를 포함하고 있어, 개방형 질문에 대한 집단적 및 개인별 인간 선호를 연구할 수 있는 기반을 제공한다. 연구 결과에 따르면, 최첨단 LM, 보상 모델, LM 평가자들은 인간 평가와의 일치도가 낮은, 평가자들 간 개별적인 취향 차이를 반영하는 모델 출력에 대해 보다 낮은 정교도(calibration)를 보이며, 전체적인 품질은 유사하게 유지된다. 종합적으로, INFINITY-CHAT는 LM에 대한 실제 세계의 개방형 질문을 체계적으로 연구할 수 있는 최초의 대규모 자원을 제공하며, 인공적 혼합사고로 인한 장기적 AI 안전 위험을 완화하기 위한 향후 연구를 안내하는 중요한 통찰을 제시한다.


AI로 AI 구축

아이디어에서 출시까지 — 무료 AI 코코딩, 즉시 사용 가능한 환경, 최적의 GPU 가격으로 AI 개발을 가속화하세요.

AI 협업 코딩
바로 사용 가능한 GPU
최적의 가격

HyperAI Newsletters

최신 정보 구독하기
한국 시간 매주 월요일 오전 9시 에 이번 주의 최신 업데이트를 메일로 발송합니다
이메일 서비스 제공: MailChimp
인공 혼합지능: 언어 모델의 개방형 동질성(그 이상을 포함하여) | 문서 | HyperAI초신경