Command Palette
Search for a command to run...
OpenAI는 129개 질문과 10개 영역에 걸쳐 AI 연구 역량을 평가하는 GeneBench-Pro를 출시했습니다.

대부분의 엔지니어링 작업과는 달리 과학 연구는 반복적이고 개방적이며 불확실성이 큽니다. 과학 연구의 핵심 과제는 분석 과정 자체를 수행하는 데 있는 것이 아니라 과학적 직관이나 "연구 취향"에 기반한 일련의 판단에 있습니다. 예를 들어, 데이터가 어떤 질문을 뒷받침할 수 있는지, 어떤 데이터를 포함해야 하는지, 어떤 추정량이나 모델을 선택해야 하는지, 진단 결과가 초기 가설을 뒤집는지, 그리고 어느 정도의 근거로 결론을 도출할 수 있는지 등이 그것입니다.
GeneBench는 이러한 배경에서 제안되었습니다. GeneBench는 단일 알고리즘의 성능을 평가하는 것이 아니라, 모델이 실제 과학적 분석 과정에서 완전한 "추론 루프"를 완료할 수 있는지 여부를 평가하려고 합니다.여기에는 데이터 이해, 품질 관리, 방법 선택, 통계 모델링, 진단 수정 및 최종 결정 도출이 포함되는데, 이러한 기능은 현대 생명 과학에서 특히 중요합니다.
이를 바탕으로,OpenAI 연구팀은 최근 GeneBench의 업데이트 버전인 GeneBench-Pro를 출시했습니다.GeneBench-Pro는 유전체학에만 국한되지 않고 분자 및 정량 생물학, 약물유전체학, 암 생물학, 미생물 유전체학, 임상 적용 등 다단계 통계적 추론이 필요한 다양한 산업 및 학술 분야를 포괄합니다. GeneBench와 비교하여 GeneBench-Pro는 29개의 문제를 추가하고 3개의 문제를 삭제했으며, 나머지 100개의 중복 문제 중 54개를 대폭 재구성했습니다.
총 129개의 문항 중 82개는 외부 전문가의 검토를 거쳤으며, 이들의 피드백을 바탕으로 힌트와 데이터가 수정되었고, 목표값을 식별할 수 없었던 문항은 재구성되었습니다. 129개 문항 전체 평가에서 GPT-5.6 Sol은 최고 추론 강도에서 28.71 TP3T의 합격률을 달성했으며, 별도로 보고된 GPT Pro 실행 결과에서 GPT-5.6 Sol Pro는 31.51 TP3T를 달성했습니다. GPT-5.5는 12.01 TP3T, GPT-5.4는 8.91 TP3T를 달성했으며, GPT를 제외한 기준 모델 중 가장 우수한 성능을 보인 Claude Opus 4.8은 16.01 TP3T를 달성했습니다.
"GeneBench-Pro: 유전체학, 양적 생물학 및 중개 생물의학에서 다단계 통계적 추론 평가"라는 제목의 관련 연구 결과는 bioRxiv에 사전 공개 논문으로 게재되었습니다.
연구 하이라이트:
* GeneBench-Pro는 기존 GeneBench를 업데이트한 버전으로, 기존 문제의 난이도를 크게 높였을 뿐만 아니라 새롭게 추가된 영역의 문제 세트를 포함하고 있습니다.
* GeneBench-Pro는 더 이상 유전체학에만 국한되지 않고 분자 및 정량 생물학, 약물유전체학, 암 생물학, 미생물 유전체학, 임상 적용 등 다단계 통계적 추론이 필요한 시나리오로 확장되었습니다.
* GeneBench-Pro는 외부 과학 검토 단계를 도입했습니다. 이 과정에서 각 질문에 대한 전체 설계, 관련 문서 및 분석 사양을 외부 분야 전문가에게 제출하여 진위성과 과학적 근거를 검증합니다.

서류 주소:
https://hyper.ai/papers/GeneBench-Pro
관련 데이터 세트는 온라인에서 이용 가능합니다.
https://hyper.ai/datasets/53157
GeneBench-Pro: 10개 주요 영역을 다루는 129개의 문항으로 구성되어 있습니다.
GeneBench-Pro는 10개의 주요 영역과 21개의 하위 영역을 다루는 129개의 문제 모음입니다.이는 에이전트가 최소한의 지침만으로 잠재적으로 결함이 있는 데이터 세트에서 필요한 정량적 분석을 식별하고 수행하여 목표 추정량(추정 대상)을 추정할 수 있는지 여부를 측정하는 데 사용됩니다. 아래 그림은 현재 평가 도구 모음의 도메인 범위를 보여줍니다.

GeneBench-Pro의 각 문제는 독립적인 과학 분석 작업으로 구성되어 있습니다.이 에이전트는 최소한의 필수 프롬프트, 단계별 데이터 파일, 그리고 표준 과학용 Python 스택을 포함하는 격리된 작업 환경을 제공받습니다. 프롬프트는 과학적 질문/작업과 목표 추정치만 제공하며, 수행할 분석 프로세스를 명시적으로 지정하지는 않습니다. 이러한 데이터 파일은 정제된 모의 데이터 세트가 아닌, 실제 분석가가 실험 또는 임상 시스템에서 얻은 원시 데이터를 최대한 모방하도록 설계되었습니다.
각 문제는 서로 연관된 일련의 결정 노드로 구성되어 있으므로, 어느 단계에서든 잘못된 선택을 하면 그 영향이 역전되어 후속 분석에 오류를 발생시키고 궁극적으로 목표 결과를 얻지 못하게 됩니다.
이 에이전트는 단계별 데이터 파일과 numpy, pandas, scipy, scikit-learn, statsmodels, lifelines, matplotlib, seaborn을 포함한 일반적인 과학 컴퓨팅 라이브러리에 접근할 수 있는 현실적인 샌드박스 환경에서 실행됩니다. 또한 PLINK 2.0, pysnptools, bed-reader, bedtools, pysam과 같은 표준 유전체 생물정보학 도구도 사용할 수 있습니다.
핵심 설계 목표: 에이전트가 최소한의 실행 가능한 힌트와 명확한 목표 추정치를 얻도록 하는 것.
개방형 과학적 분석을 정확하게 벤치마킹하기 어려운 이유는 실제 데이터에서 여러 가지 합리적인 분석 옵션이 존재하기 때문입니다. 예를 들어, 품질 관리(QC) 임계값, 모델 매개변수 설정, 보고 기준 등이 분석가마다 다를 수 있지만, 이러한 차이가 단 하나의 접근 방식만이 옳다는 것을 의미하지는 않습니다. 분석가가 합리적이지만 서로 다른 기준점이나 관례를 선택함으로써 벤치마킹 결과가 달라지는 경우, 이러한 차이는 과학적 추론의 질보다는 벤치마킹 설계 자체의 자의성을 반영하는 것일 수 있습니다.
"실패"가 자연적인 붕괴가 아닌 진정한 과학적 오류를 나타내도록 하기 위해,연구진은 GeneBench-Pro에서 구성적 시뮬레이션 문제를 활용했습니다. 즉, 완전한 인과 구조를 알고 있으며 데이터 생성 과정을 명시적으로 시뮬레이션했습니다.
연구자들은 분석 과정에서 합리적이지만 잘못된 선택이 후속 결과의 질적 변화로 이어질 수 있는 주요 추론 분기점인 "의사결정 지점의 수"를 사용하여 연쇄 구조를 정량화합니다.
실제로 각 문제는 실제 분석 모델과 목표 추정기를 기반으로 구축됩니다. 이러한 실제 분석 모델은 문헌과 해당 분야 전문가의 경험을 바탕으로 도출되며, 일반적이고 영향력이 큰 과학적 문제와 워크플로를 반영하는 것을 목표로 합니다. 또한, 모델이 단순히 암기에 의존하여 문제를 해결하는 것을 방지하기 위해 교과서나 논문에 나오는 표준 사례를 직접 재현하는 것을 의도적으로 피합니다.
그다음, 시뮬레이션을 통해 데이터를 생성하여 단계별 데이터로부터 정답을 복구할 수 있도록 합니다. 마지막으로, 정답을 식별하는 데 필요한 최소한의 정보만을 포함하는 최소 실행 가능 힌트를 구성합니다.
문제의 초기 초안 작성이 완료되면 대규모 검증을 실시할 것입니다. 추론의 여러 단계에서 "그럴듯해 보이지만 틀린" 경로에 대해서는 제거 실험을 통해 해당 경로를 분석하고, 그 결과가 정답과 충분히 구별되는지 검증할 것입니다.
또한, 방법론의 합리성, 목표의 명확성 및 과학적 타당성을 평가하기 위해 독립적인 과학적 검토가 수행될 것입니다.
다음 표는 이러한 설계 요구사항에서 도출된 주요 기본 제약 조건을 요약한 것입니다.

예시 문제: DRX1 보인자 선별 검사에서 잔여 위험도
아래 이미지는 상염색체 열성 유전 질환에 대한 보인자 검사 시나리오를 시뮬레이션하는 GeneBench-Pro 문제를 보여줍니다. 이 가상 검사 환경에서 DRX1은 질병을 유발하는 유전자이며, 생물학적 부모 모두가 보고 가능한 DRX1 대립유전자를 보유하고 있을 경우에만 자손에게 생식 위험이 발생합니다.

담당자는 원시 보인자 검사 데이터를 제공받고, "검사 결과가 음성"인 경우 남은 보인자 위험을 추정하여 이 잔여 위험을 잠재적 생식 파트너 집단의 보인자 빈도와 결합해야 합니다.
이 문제의 어려움은 원래의 전송률로부터 직접적으로 답을 추정할 수 없다는 점에 있습니다. 정확한 분석을 위해서는 여러 추론 단계를 순차적으로 완료해야 합니다.
· 첫째, 보고 가능한 DRX1 캐리어 범주를 식별하고 복제 수 변이 아티팩트를 구분합니다.
· 다음으로, 단계별 모델의 창시자 마커를 처리하고, 그것이 단일 하플로타입으로 간주되어야 하는지 여부를 결정합니다.
· 그런 다음, 다양한 공변량을 기반으로 탐지의 민감도와 오탐률을 추정했습니다.
· 다음으로, 각 범주별 보균자 미검출 확률을 기반으로 음성 선별검사 조건에서의 잔존 보균자 위험을 계산합니다.
· 마지막으로, 제휴 통신사의 빈도는 탐지된 일부에 국한되지 않고 전체 제휴사 목록에 맞춰 표준화되어야 합니다.
이 예시는 다음을 보여줍니다. GeneBench-Pro의 핵심 설계 목표는 에이전트가 최소한의 실행 가능한 힌트와 명확한 목표 추정치를 얻도록 하는 것입니다.하지만 궁극적인 성공 여부는 단순히 미리 설정된 프로세스를 실행하는 것이 아니라, 데이터로부터 완전한 다단계 정량 분석 경로를 복원할 수 있는지에 달려 있습니다.
결과: 능력 면에서 상당한 향상이 있었지만, "추론 과정"이 아직 완전히 확립되지는 않았습니다.
연구진은 GPT-5.2, GPT-5.4, GPT-5.5, GPT-5.6 Luna/Terra/Sol 및 해당 GPT Pro 변형 모델을 포함한 60가지 모델 구성과 Claude, Gemini, Grok, GLM, Kimi, DeepSeek, MiMo, Tencent, MiniMax, Qwen의 비GPT 기본 모델을 포함하여 총 129개의 질문으로 구성된 전체 테스트 세트에서 GeneBench-Pro를 평가했습니다. 아래 그림은 질문별로 계산된 가중치가 적용되지 않은 통과율을 요약한 것입니다.

전반적인,해당 모델의 전반적인 합격률은 여전히 낮습니다.
· 각 GPT 메인라인 모델의 최고 추론 강도에서, 가중치가 적용되지 않은 평균 통과율은 GPT-5.2(xhigh)의 4.9%에서 GPT-5.4(xhigh)의 8.9%, GPT-5.5(xhigh)의 12.0%, GPT-5.6 Luna(max)의 16.5%, GPT-5.6 Terra(max)의 23.3%, 그리고 GPT-5.6 Sol(max)의 28.7%로 증가했습니다.
· 별도로 보고된 GPT Pro 결과는 다음과 같습니다. GPT-5.2 Pro 8.5%, GPT-5.4 Pro 16.3%, GPT-5.5 Pro 20.5%, GPT-5.6 Luna Pro 23.6%, GPT-5.6 Terra Pro 28.5%, GPT-5.6 Sol Pro 31.5%.
· GPT를 사용하지 않은 모델의 결과는 약 0.6%에서 16.0% 사이이며, Claude Opus 4.8이 GPT를 사용하지 않은 기준 모델 중 가장 강력한 모델입니다.
· GPT 시리즈 내에서 추론 강도를 높이면 성능에 상당한 영향을 미칩니다. GPT-5.6 Sol은 추론 강도가 '없음'일 때 3.7%에서 '낮음'일 때 14.4%, '중간'일 때 22.5%, '높음'일 때 24.4%, '매우 높음'일 때 26.8%, '최대'일 때 28.7%로 증가했습니다.
동시에,해결되지 않은 중요한 문제들이 여전히 남아 있습니다.가장 강력한 GPT 메인라인 모델에서 "0.% 통과율 문제"의 비율은 GPT-5.2의 77.5%에서 GPT-5.4의 67.4%, GPT-5.5의 64.3%, 그리고 GPT-5.6 Sol의 45.7%로 감소했습니다. 반면 "최소 50% 통과율 문제"의 비율은 1.6%에서 4.7%, 8.5%, 그리고 30.2%로 증가했습니다. 따라서 가장 강력한 메인라인 모델에서도 기준선은 여전히 고난이도 문제로 주로 구성되어 있지만, 더 강력한 모델은 "완전 실패" 상태의 문제를 부분 성공 또는 안정적인 성공으로 전환시킬 수 있습니다.
결론
GeneBench-Pro의 핵심적인 공헌은 새로운 생물학적 벤치마크를 구축하는 것뿐만 아니라 "과학적 에이전트 역량"을 평가하는 방식을 재정의하려는 시도에 있습니다. 실험 결과에 따르면 현재 최첨단 모델들은 데이터 이상 식별, 통계적 신호 이해, 표준 분석 절차 수행과 같은 일정 수준의 "국소적 과학적 역량"을 갖추고 있습니다. 그러나 이러한 역량은 아직 엔드투엔드 과학적 분석으로 안정적으로 확장되지 못했으며, "문제 식별"과 "조치 실행" 사이에는 여전히 상당한 격차가 존재합니다.
응용 관점에서 볼 때, 이 혁신은 상당한 잠재적 가치를 지닙니다. 현대 생명과학에서 유전자 데이터에서 표적 스크리닝으로, 그리고 통계적 신호에서 임상 적용 결정에 이르는 과정은 전문가 팀의 협업에 크게 의존하며 비용이 많이 듭니다. 이 논문은 GeneBench-Pro를 이용한 문제 해결에 사람의 도움 없이 일반적으로 10시간에서 40시간이 소요된다는 점을 지적하며, 부분적인 자동화만으로도 산업 연구에서 상당한 경제적 가치를 창출할 수 있음을 보여줍니다.
하지만 연구자들은 현재 모델이 전체 추론 과정을 일관되게 완료할 수 없기 때문에 이 과정을 확실하게 대체할 수 없다고 강조합니다. 향후 개선 사항에는 더욱 강력한 계획 기능, 자체 수정 메커니즘 및 불확실성 모델링 기능이 포함될 수 있습니다.
참고문헌:
https://www.biorxiv.org/content/10.64898/2026.06.29.735386v2








