HyperAIHyperAI

Command Palette

Search for a command to run...

칭화대학교, MIT, 하버드대학교 등을 포함한 여러 대학이 11개 학문 분야와 60개 연구 과제를 아우르는 ASI-Bench를 제안하여 AI의 독립적인 연구 능력을 시험하고자 합니다.

Featured Image

최근 몇 년 동안 대규모 언어 모델과 지능형 에이전트 기술이 급속도로 발전하면서 과학 연구에 인공지능이 참여하는 범위가 끊임없이 확장되고 있습니다. 문헌 검토와 코드 작성부터 데이터 분석에 이르기까지 점점 더 많은 표준화된 과학 연구 과정이 인공지능의 도움으로 완료될 수 있으며, 일부 지능형 에이전트 시스템은 특정 과학 연구 하위 작업을 독립적으로 수행하려는 시도까지 시작했습니다. 그러나 여전히 체계적인 해답이 없는 더욱 중요한 질문이 남아 있습니다. 연구자들이 명확한 방법과 실행 경로를 제시하는 대신 해결해야 할 과학적 문제만 제시할 때, 과연 어떻게 해결해야 할까요?인공지능이 자율적으로 연구를 완료할 수 있는 범위는 어느 정도인가?

기존 연구 벤치마크는 이 질문에 답하는 데 어려움을 겪습니다. 한 가지 유형의 평가는 주로 모델이 기존 과학 지식을 얼마나 잘 이해하는지를 평가하는데, 이는 본질적으로 "알려진 답을 가진 지식 기반 질문 답변"에 가깝습니다. 또 다른 유형은 코드 실행 및 도구 사용을 포함하지만, 연구 방법이나 운영 절차를 미리 정의하여 AI가 미리 정해진 프로세스에 따라 작업을 완료할 수 있는지 여부를 주로 테스트합니다. 이러한 벤치마크는 지식 이해 및 연구 실행 능력을 측정할 수 있지만, 다양한 영역을 더욱 세분화하여 구분하는 데는 한계가 있습니다.인공지능은 연구 해결책을 자율적으로 설계할 수 있는 진정한 능력을 갖춘 것일까, 아니면 단순히 인간이 이미 제시한 해결책을 모방하는 것에 불과한 것일까?

이를 위해 칭화대학교, MIT, 하버드대학교, 카네기멜론대학교, 마이크로소프트 리서치 등 10개 이상의 기관에서 40명 이상의 분야별 전문가들이 공동으로 3만 1천 시간 이상을 투자하여 독립적인 연구 역량을 측정하는 벤치마크인 ASI-Bench를 구축했습니다. ASI-Bench의 핵심 아이디어는 단순히 문제의 난이도를 높이는 것이 아니라, 동일한 연구 프로젝트에 대해 인간이 제공하는 방법론적 정보의 양을 점진적으로 줄여가면서 AI의 성능 변화를 관찰하고, 이를 통해 시스템의 인간 지도 의존도를 정량화하는 것입니다.

"ASI-Bench: 인공 초지능의 여명"이라는 제목의 관련 연구 결과는 논문 사전 공개 플랫폼인 arXiv에 게재되었습니다.

논문 보기: https://hyper.ai/papers/2608.17271

데이터셋: 11개 주요 분야를 포괄하는 프로젝트 수준의 연구 과제 저장소

ASI-Bench는 실제 연구 문제를 모델로 한 프로젝트 수준의 작업 세트를 기반으로 합니다. 기존 벤치마크의 지식 기반 질문이나 표준화된 연습 문제와는 달리, 각 작업은 에이전트가 문제 이해, 방법 선택, 코드 구현, 실험 실행, 오류 검사 및 결과 반복과 같은 여러 단계를 거쳐야 하는 비교적 완성도 높은 소규모 연구 프로젝트로 설계되었습니다.

이 과제는 기초 과학, 생명 과학, 공학 기술 등 다양한 분야를 아우르는 1,300편 이상의 학술 논문과 최첨단 연구 질문에서 시작되었습니다.연구팀은 먼저 해당 분야 전문가들을 통해 대표적인 연구 주제들을 선정하고, 엔지니어링 수정 및 타당성 검증을 거쳐 원래 미해결 상태였던 연구 질문들을 통합된 환경에서 실행하고 평가할 수 있도록 합니다. 이 과정에서 과학적 논리적 오류가 있거나, 결과 재현이 어렵거나, 운영 조건이 불안정하거나, 난이도가 지나치게 불균형한 과제들은 제외됩니다.

결정적인,ASI-Bench에는 60개의 연구 과제가 저장되어 있습니다.이 벤치마크는 수학, 물리학, 화학, 생물학, 천문학, 재료과학, 지구과학, 의료통계학, 컴퓨터 과학, 로봇공학, 전기공학 등 11개 분야를 포괄합니다. 각기 다른 과제는 서로 다른 데이터 형식, 연구 방법, 검증 기준을 요구하므로, 특정 학문 분야나 고정된 문제 해결 방식에 벤치마크가 좌우되는 것을 어느 정도 방지합니다.

물리학, 천문학, 전기공학, 컴퓨터 과학 등 다양한 분야를 아우르는 ASI-Bench의 대표적인 프로젝트 수준 과제들입니다.
물리학, 천문학, 전기공학, 컴퓨터 과학 등 다양한 분야를 아우르는 ASI-Bench의 대표적인 프로젝트 수준 과제들입니다.
각 작업에는 완전한 연구 목표, 구체적인 입력 데이터, 실행 환경, 명확한 출력 요구 사항 및 정량적 평가 규칙이 포함됩니다. 에이전트는 작업에 진입한 후, 획득한 정보를 바탕으로 연구 과정을 독립적으로 계획하고 코드와 도구를 사용하여 실험을 완료해야 합니다. 60개의 작업에는 총 2,600회 이상의 에이전트 상호 작용과 2,400회의 코드 실행이 포함되었습니다.한 담당자가 모든 작업을 완료하는 데 걸리는 누적 시간이 35시간을 초과합니다.

과학 연구 과제의 본질적인 개방성을 고려할 때, 벤치마크가 "실제로 실행 가능한지" 그리고 채점 방식이 "효과적인지"를 보장하는 것이 무엇보다 중요합니다. 이를 위해 연구팀은 5차례에 걸쳐 전문가 간 검토를 진행하여 1,100건 이상의 검토 과제와 2,000건 이상의 과제 수정 작업을 수행했습니다. 이러한 기반 위에 모든 과제는 격리된 샌드박스 환경에서 1,500회 이상의 엔드투엔드 테스트를 거쳐 참조 솔루션의 재현성과 채점 프로그램의 안정적인 작동을 검증했습니다. 최종적으로, 이러한 과정을 통해 과학적 합리성과 공학적 실현 가능성의 균형을 이룬 프로젝트 수준의 연구 과제 라이브러리가 구축되었습니다.

방법론적 지침의 단계적 제거 및 연구 자율성 정량화

ASI-Bench의 가장 눈에 띄는 디자인입니다.핵심은 서로 다른 능력에 맞춰 서로 다른 문제를 설계하는 것이 아니라, 지능형 에이전트들을 동일한 연구 프로젝트에 참여시키고 인간이 제공하는 방법론적 정보만 변경한다는 점입니다.연구 목표, 입력 데이터, 운영 환경, 최종 결과물 및 평가 기준은 변경되지 않으며, 유일한 차이점은 시스템이 받는 연구 지침의 양입니다. 정보가 점진적으로 감소함에 따라 모델 점수의 변화를 관찰함으로써, 인공지능의 어려움이 실행, 방법 구현 또는 연구 경로의 자율적 선택 중 어느 부분에서 비롯되는지 추가적으로 파악할 수 있습니다.

ASI-Bench 개요. 왼쪽: 다양한 에이전트의 B3 성능. 오른쪽: B1부터 B4까지의 점수.
ASI-Bench 개요. 왼쪽: 다양한 에이전트의 B3 성능. 오른쪽: B1부터 B4까지의 점수.
ASI-Bench는 각 작업을 B1, B2, B3, B4의 네 가지 레벨로 분류합니다.

B1:완벽한 방법론적 지침을 제공합니다. 시스템은 지배 방정식, 수치 방법, 주요 구현 단계 및 매개변수 설정을 포함하여 비교적 완전한 연구 계획을 얻을 수 있습니다. 지능형 에이전트는 기존 계획을 코드로 변환하고 실행하기만 하면 되므로 과학 연구 실행 능력 평가와 더욱 유사합니다.

B2:방법 범주만 제공됩니다. 상세한 구현 단계는 제거되며, 시스템은 방법 범주와 핵심 원리만 파악할 수 있습니다. 예를 들어, 시스템은 특정 문제가 스펙트럴 방법을 사용하여 해결하기에 적합하다는 것을 알 수 있지만, 이산화 방법, 적분 전략, 매개변수 설정 방법 등은 모두 수동으로 결정해야 합니다. 이 단계에서는 인공지능이 추상적인 방법을 실제로 활용 가능한 연구 프로세스로 변환할 수 있는지 여부를 주로 검증합니다.

B3:연구 목표와 데이터만 제공됩니다. 방법론에 대한 모든 힌트는 제거되며, 에이전트는 원시 데이터, 연구 목표 및 결과물 요구사항만 볼 수 있습니다. 에이전트는 문제의 본질을 스스로 파악하고, 연구 방법을 선택하고, 계산 과정을 설계하고, 실험을 완료해야 합니다. 이는 ASI-Bench에서 독립적인 연구 역량을 측정하는 핵심 요소이기도 합니다.

B4:관련성이 없고 주의를 분산시키는 정보를 추가합니다. B3 단계를 기반으로, 사실은 정확하지만 과제와 관련 없는 배경 자료, 검증되지 않은 방법론적 추측, 그리고 기타 시나리오 정보를 추가하여 시스템이 복잡한 정보 환경에서 진정으로 연구 관련 콘텐츠를 식별하고 정상적인 연구 프로세스를 유지하는 능력을 테스트합니다.

이러한 설정 덕분에 "독립적 연구"는 더 이상 일반적인 개념에 그치지 않고 여러 단계로 세분화될 수 있습니다. 예를 들어, 모델이 B1 단계에서는 좋은 성능을 보였지만 B2 단계에서 성능이 크게 저하된다면, 문제는 코드 실행 자체가 아니라 모델이 연구 계획을 스스로 완수할 수 있는지 여부에 있을 수 있습니다. 만약 B2에서 B3 단계로 넘어가는 동안에도 성능이 급격히 저하된다면, 방법론 및 연구 설계 선택이 새로운 주요 장애물임을 나타냅니다.

외부 요인의 간섭을 최소화하기 위해 ASI-Bench는 모든 작업을 격리된 샌드박스 환경에서 실행합니다. 에이전트는 작업에 필요한 사전 제공된 데이터와 도구에만 접근할 수 있으며, 온라인 검색이나 외부 지식 기반에는 접근할 수 없습니다. 따라서 최종 결과는 모델의 데이터 검색 능력보다는 추론, 계획 및 실행 능력을 더 잘 반영합니다.

4단계 정보 기울기를 기반으로**ASI-Bench는 다양한 기능 간의 차이점을 더욱 자세히 분석할 수 있습니다.**B1과 B2의 변화는 방법론을 구체적인 프로세스로 변환하는 능력을 반영하고, B2와 B3의 변화는 방법론을 자율적으로 선택하고 연구 계획을 설계하는 능력을 반영하며, B3와 B4의 변화는 중복 정보에 직면했을 때 시스템의 견고성을 반영합니다.

실험적 검증: 최첨단 시스템 18종의 성능 및 기능 한계

ASI-Bench를 기준으로연구팀은 "지능형 에이전트 프레임워크 + 대규모 기본 모델"로 구성된 18개의 최첨단 시스템을 평가했습니다.이 테스트는 Codex, Claude Code, Kimi Code, MiMo Code, OpenHands와 같은 지능형 에이전트 프레임워크와 GPT-5.5, GPT-5.6 Sol, Claude Opus, GLM, DeepSeek, Kimi, MiMo, MiniMax와 같은 모델을 다룹니다. 모든 시스템은 격리된 환경에서 실행되며, 각 작업은 독립적으로 세 번씩 실행된 후 평균 결과가 사용됩니다.

실험 결과는 다음과 같습니다.인간의 지도력이 줄어들면서 AI의 연구 성과는 급격히 떨어졌다. 18개 시스템은 B1 단계에서 완전한 방법론 안내를 받았을 때 평균 50.91점을 달성했습니다. 방법론 범주만 제공하는 B2 단계에서는 평균 점수가 29.10점으로 떨어졌고, 방법론 힌트가 완전히 제거된 B3 단계에서는 평균 점수가 26.62점으로 더욱 하락했습니다. 가장 우수한 성능을 보인 시스템은 Codex + GPT-5.6 Sol(ultra)로, B3 단계에서 51.60점을 기록하며 유일하게 50점을 넘었습니다. 추론 강도를 높이면 결과가 향상되었는데, 예를 들어 GPT-5.6 Sol을 xhigh에서 ultra로 업그레이드하면 B3 점수가 10.74점 상승했습니다. 그러나 전반적으로 현재 시스템들은 안정적인 개방형 자율 연구를 달성하기까지 여전히 상당한 격차를 보이고 있습니다.

외부 도구 없이 프로젝트 수준 작업 60개를 완료한 주요 결과
외부 도구 없이 프로젝트 수준 작업 60개를 완료한 주요 결과
정보 수준별 점수 차이를 분석한 결과, 보다 구체적인 기술 격차가 드러났습니다. B1에서 B2로 넘어갈 때 시스템의 평균 점수는 21.82점 감소했고, B2에서 B3로 넘어갈 때는 방법 범주 힌트를 추가로 제거했음에도 평균 점수는 2.48점만 감소했습니다. 이는 다음과 같은 의미입니다...오늘날 인공지능의 주된 어려움은 "어떤 방법을 사용할 것인가"를 결정하는 것이 아니라, 기존의 방법론적 아이디어를 매개변수 선택, 코드 구현, 실험 실행 및 결과 검증으로 구성된 완전한 프로세스로 어떻게 발전시킬 것인가에 있다.한편, B4는 관련 없는 정보와 방해 정보를 추가한 후 평균 26.99점을 기록했는데, 이는 B3의 26.62점과 거의 동일한 수치로, 적어도 현재의 과제 설정에서는 정보 잡음이 주요 제한 요소가 아님을 나타냅니다.

이번 실험을 통해 자율 연구 능력이 기본 모델에 의해서만 결정되는 것은 아니라는 사실이 밝혀졌습니다. 동일한 모델이라도 서로 다른 에이전트 프레임워크와 조합하면 상당히 다른 결과를 나타낼 수 있습니다. 예를 들어, MiMo V2.5 Pro는 Claude Code와 조합했을 때 MiMo Code에 비해 전체 점수가 40% 이상 향상되었으며, Kimi K2.7 또한 Kimi Code보다 Claude Code 프레임워크에서 더 나은 성능을 보였습니다. 이는 작업 계획, 도구 호출, 오류 수정, 프로세스 스케줄링과 같은 에이전트 메커니즘이 연구 작업 완료 품질에 직접적인 영향을 미친다는 것을 시사합니다.

마지막으로, 시스템마다 비용과 성능 사이에 단순한 선형 관계가 존재하지 않습니다. 예를 들어, Codex + GPT-5.6 Sol(xhigh)의 실행 비용은 Claude Opus 5의 약 4분의 1 수준이지만, B3 점수는 유사합니다. 최고 성능을 보이는 GPT-5.6 Sol(ultra)의 실행 비용은 약 1,550달러입니다. 따라서 실제 과학 응용 분야에서는 모델 성능뿐만 아니라 계산 효율성도 고려해야 합니다. 추론에 더 많은 투자를 하면 성능의 상한선을 높일 수 있지만, 연구 과제를 합리적인 비용으로 안정적으로 완료할 수 있는지 여부 또한 자율 연구 시스템이 실용화로 나아가기 위해 해결해야 할 과제입니다.

비용-성능 상충 관계에서 에이전트×모델 조합의 다양한 안내 수준 및 계산 비용
비용-성능 상충 관계에서 에이전트×모델 조합의 다양한 안내 수준 및 계산 비용

마지막 말

오랫동안 인공지능의 연구 능력 평가는 과학적 질문에 답하고, 논문 결과를 재현하고, 할당된 실험을 완료하는 데 초점을 맞춰왔습니다. 하지만 ASI-Bench는 한 걸음 더 나아가, 인간이 구체적인 방법과 실행 경로를 제공하지 않을 때 인공지능이 얼마나 많은 연구 작업을 독립적으로 수행할 수 있는지를 평가합니다. 평가 결과에 따르면 인공지능은 이미 명확하게 정의된 경로를 가진 작업은 상당히 잘 수행할 수 있지만, 개방형 자율 연구를 안정적으로 수행할 수 있는 능력과는 여전히 큰 격차가 있습니다. 미래의 연구 에이전트 개선은 단순히 더 강력한 모델과 더 많은 컴퓨팅 파워에만 의존할 수 없습니다. 작업 계획 수립, 실험 피드백 활용, 오류 수정 능력 향상 또한 필수적입니다. 인공지능의 연구 능력 측정 기준은 점차 "얼마나 많은 질문에 정확하게 답했는가"에서 "얼마나 많은 실제 연구 작업을 독립적으로 완료할 수 있는가"로 바뀔 것입니다.