Command Palette
Search for a command to run...
게이트형 어텐션을 통한 대규모 언어 모델: 비선형성, 희소성 및 어텐션 싱크 없음
게이트형 어텐션을 통한 대규모 언어 모델: 비선형성, 희소성 및 어텐션 싱크 없음
초록
게이팅 메커니즘은 초기의 LSTMs와 Highway Networks에서부터 최신의 스페이스 모델, 선형 어텐션, 소프트맥스 어텐션에 이르기까지 광범위하게 활용되어 왔다. 그러나 기존의 문헌은 게이팅의 구체적 효과에 대해 거의 다루지 않고 있다. 본 연구에서는 게이팅을 보강한 소프트맥스 어텐션의 다양한 변형을 체계적으로 탐구하기 위해 종합적인 실험을 수행한다. 구체적으로, 3.5조 토큰 규모의 데이터셋에 기반하여 훈련된 150억 파라미터의 믹스처 오브 익스퍼트(MoE) 모델 30개 변형과 17억 파라미터의 밀집 모델 30개 변형을 종합적으로 비교 분석한다. 본 연구의 핵심 발견은, 스케일드 도트-프로덕트 어텐션(SDPA) 후에 헤드별 시그모이드 게이트를 적용하는 간단한 수정이 일관되게 성능을 향상시킨다는 점이다. 이 수정은 훈련의 안정성을 높이고, 더 큰 학습률을 견딜 수 있도록 하며, 모델의 확장성도 향상시킨다. 다양한 게이팅 위치와 계산적 변형을 비교한 결과, 이 효과의 근본 원인은 두 가지 핵심 요인에 기인함을 밝혀냈다. 첫째, 소프트맥스 어텐션 내에서 낮은 랭크 맵핑에 비선형성을 도입하는 것이며, 둘째, 쿼리에 의존적인 희소 게이팅 점수를 적용하여 SDPA 출력을 조절하는 것이다. 특히, 이 희소 게이팅 메커니즘이 막대한 활성화 현상과 어텐션 싱크 문제를 완화하고, 긴 컨텍스트 외삽 성능을 향상시킨다는 점을 확인하였다. 또한, 향후 연구를 촉진하기 위해 관련 코드(https://github.com/qiuzh20/gated_attention)와 모델(https://huggingface.co/QwQZh/gated_attention)을 공개한다. 더불어, 가장 효과적인 SDPA 출력 게이팅 구조는 Qwen3-Next 모델들(https://huggingface.co/collections/Qwen/qwen3-next)에도 적용되었다.