HyperAIHyperAI

Command Palette

Search for a command to run...

중첩은 강력한 신경망 스케일링을 초래한다

Yizhou Liu Ziming Liu Jeff Gore

초록

현재의 대규모 언어 모델(Large Language Models, LLMs)이 성공하는 데는 모델이 클수록 성능이 향상된다는 관찰이 핵심이다. 그러나 모델 크기와 함께 손실(loss)이 거듭제곱 법칙에 따라 감소하는 신경망 규모 법칙(nerual scaling law)의 기원은 여전히 명확하지 않다. 본 연구에서는 LLMs가 가진 차원 수보다 더 많은 특징을 동시에 표현할 수 있는 '표현 초점화(representation superposition)'가 손실 감소와 신경망 규모 법칙의 핵심 요인일 수 있음을 제안한다. 앤트로피크(Anthropic)의 단순 모델을 기반으로, 가중치 감쇠(weight decay)를 통해 초점화의 정도를 조절함으로써 모델 크기에 따른 손실의 변화를 체계적으로 분석할 수 있었다. 초점화가 약할 경우, 손실이 거듭제곱 법칙에 따라 감소하려면 데이터 특징의 빈도 분포가 거듭제곱 법칙을 따르는 것이 필요하다. 반면, 강한 초점화 조건에서는 표현 벡터 간의 기하학적 겹침(geometric overlaps)으로 인해 다양한 빈도 분포에 걸쳐 손실이 모델 차원에 반비례하여 감소하는 경향이 일반적으로 나타난다. 우리는 공개된 LLM들이 강한 초점화 상태에 있으며, 손실이 모델 차원에 반비례하여 감소함을 확인하였으며, 이는 찰린치아(Chinchilla) 규모 법칙과도 일치함을 입증하였다. 본 연구 결과는 표현 초점화가 신경망 규모 법칙의 중심적 원인임을 밝히며, 신경망 규모 법칙이 언제 개선될 수 있고 언제 붕괴될 수 있는지에 대한 통찰을 제공한다.


AI로 AI 구축

아이디어에서 출시까지 — 무료 AI 코코딩, 즉시 사용 가능한 환경, 최적의 GPU 가격으로 AI 개발을 가속화하세요.

AI 협업 코딩
바로 사용 가능한 GPU
최적의 가격

HyperAI Newsletters

최신 정보 구독하기
한국 시간 매주 월요일 오전 9시 에 이번 주의 최신 업데이트를 메일로 발송합니다
이메일 서비스 제공: MailChimp
중첩은 강력한 신경망 스케일링을 초래한다 | 문서 | HyperAI초신경