HyperAIHyperAI

Command Palette

Search for a command to run...

27B AI의 과학자 논문 재현 능력이 GPT-5.5/Claude Opus 4.8을 능가했습니다. 패러데이는 장기적인 과학 혁신에 대해 연구합니다.

Featured Image

연구 논문의 재현성은 과학적 지식 체계의 초석입니다. 이는 기존 연구 결과의 신뢰성을 보장할 뿐만 아니라 추가 실험을 위한 토대를 제공합니다.

하지만 현재 여러 과학 분야, 특히 머신러닝 분야에서 "재현성 위기"가 발생하고 있습니다. 이론적으로 대규모 언어 모델(LLM) 기반의 AI 에이전트는 이러한 위기에 대한 확장 가능한 해결책을 제공할 수 있지만, 실제로는 기존 AI 에이전트가 세 가지 주요 영역에서 재현성 문제를 해결해야 하는 과제에 직면해 있습니다.첫 번째,논문을 재현하는 데 있어 가장 큰 문제점은 정보가 불완전하다는 점입니다. 즉, 논문은 발견으로 이어진 전체 연구 과정을 손실 압축한 형태로만 제공하기 때문에 필연적으로 일부 세부 사항이 누락됩니다.둘째,기존 AI 에이전트는 주로 잘 정의된 폐쇄형 문제에 대해 광범위하게 훈련되었지만, 논문 재현에는 에이전트가 개방형 탐색을 수행해야 합니다. 마지막으로, 일반적인 재현 작업의 경우 지속적인 "향상" 최적화에 사용할 수 있는 명확한 보상 함수가 없습니다.

이러한 도전에 대응하여,인히런트 랩스(Inherent Labs)의 연구팀은 과학 연구 논문을 재현할 수 있는 패러데이(Faraday)라는 인공지능 과학자 에이전트를 훈련시켰습니다.이 LLM 기반 에이전트는 인간 AI 연구자들이 프로그래밍된 에이전트를 사용하는 방식과 유사하게 Codex GPT-5.5를 도구로 사용합니다. 기준 기반 평가에서 Faraday는 73%의 분포 내 머신 러닝 작업과 60%의 과학 분야 AI 작업에서 Claude Opus 4.8 및 GPT-5.5보다 우수한 성능을 보였습니다.

주목할 만한 점은 패러데이 알고리즘이 270억 개의 매개변수만을 가지고 있음에도 불구하고 5조 개의 매개변수를 가진 모델을 지원할 수 있다는 것입니다. 이를 통해 더 큰 모델만을 사용할 때보다 실질적으로 상당한 성능 향상을 달성할 수 있습니다. 단일 실행에 대한 정성적 분석 결과, 패러데이 알고리즘이 더욱 과학적으로 타당한 접근 방식을 사용한다는 것을 알 수 있습니다.

"AI 과학자들이 연구를 재현하도록 훈련하기"라는 제목의 관련 연구 결과는 arXiv에 사전 공개 논문으로 게시되었습니다.

연구 하이라이트:

* 본 연구는 1990년부터 2026년까지 Machine Learning 및 AI for Science 분야에 발표된 100편의 논문에서 그래프 재현 작업 310개를 추출하여 자동 생성된 작업 공간을 구축했습니다.

* 본 연구는 장기간에 걸쳐 검증이 불가능한 작업에 적합한 안정적인 GRPO 사후 학습 방법을 제안합니다. 이 방법은 각 작업에 대한 평가 기준, 다중 샘플 평가 결과의 통합, 그리고 라운드별 점수 배분 메커니즘을 포함합니다.

* 본 연구에서는 코딩 에이전트를 도구로 활용할 수 있는(CAT) 270억 개의 매개변수를 가진 에이전트를 훈련시켰습니다. 양적 및 질적 실험 모두에서 Faraday가 더 높은 과학적 엄밀성을 보여준다는 것이 입증되었습니다.

서류 주소: https://hyper.ai/papers/2608\.13331

자동으로 생성된 작업 공간 복제본을 빌드합니다.

연구원들은 Faraday를 훈련시키기 위해 Replica라는 확장 가능한 작업 공간을 구축했습니다. Replica 작업 공간은 242개의 훈련 작업과 68개의 테스트 작업으로 구성되며, 이 작업들은 잘 알려진 머신 러닝(ML) 및 과학 분야 인공지능 논문 100편에서 추출되었습니다.각 작업은 에이전트가 논문에 제시된 결과 그림을 재현하도록 요구합니다. 에이전트는 그림 마스킹 처리된 원본 논문을 얻을 수 있으며, 60분의 시간 제한 내에 H200 GPU의 1/7 MIG 슬라이스만 사용할 수 있습니다.

이 시스템은 에이전트에게 유용한 연구 라이브러리가 사전 탑재된 컨테이너화된 환경을 제공하며, 인터넷 접속, 시스템 프롬프트 및 작업 프롬프트를 제공합니다. 논문에 제시된 실험을 할당된 시간 내에 완료할 수 없는 경우, 프롬프트는 에이전트에게 실험을 최대한 원래 실험과 유사하게 확장한 후 완료하도록 지시합니다.

* 학습 과제는 1990년부터 2026년 사이에 발표된 기계 학습 논문에서 발췌했습니다.

* 테스트 과제는 2012년부터 2026년 사이에 발표된 과학 분야 인공지능 논문에서 발췌되었습니다.

이러한 작업들은 모두 자동으로 생성되므로 전체 작업 공간의 확장성이 뛰어나다는 점에 주목할 필요가 있습니다. 주어진 논문에 대해 시스템은 Gemini 2.5 Pro 기반의 세 가지 시각 언어 처리 단계를 거쳐 논문을 작업으로 변환합니다. 첫 번째 단계는 스캔 단계로, 논문에 포함된 모든 그림과 그림 설명문을 식별합니다. 두 번째 단계는 위치 파악 단계로, LLM 검증기의 복구 루프에서 그림의 경계 상자를 결정합니다. 마지막으로, 그림은 PDF에서 영구적으로 마스킹됩니다. 완전한 작업은 그림 설명문, 추출된 원본 그림("골드 플롯"), 그리고 그림이 마스킹된 논문의 세 부분으로 구성됩니다.

연구팀은 각 작업을 수동으로 검토하고 차트 범위가 불충분하거나, 결과 차트가 아니거나, 캡션이 잘못되었거나 하는 등 품질이 낮은 작업을 걸러냅니다.각 논문은 1~13개의 과제를 제공하며, 중앙값은 2개입니다.

장기간 검증 불가능한 작업에 적합한 안정적인 GRPO 사후 학습 방법

간단한 에이전트 프레임워크

Agent Harness는 대규모 언어 모델(LLM, 입력과 출력 모두 토큰임)과 환경(입력 동작/출력 상태) 간의 인터페이스를 제공합니다.

* 사용 가능한 기능 및 컨텍스트

에이전트는 `apply_patch`, `read_file`, `list_dir`, `grep_files`, `shell`의 다섯 가지 함수 호출을 통해 작업을 실행합니다. Faraday는 `shell` 도구를 사용하여 백그라운드 프로세스를 현재 세션에서 분리함으로써 여러 명령을 병렬로 실행하면서 여러 단계의 작업을 수행할 수 있습니다. 각 단계 내의 도구 호출은 동시에 실행되며, 결과는 호출된 순서대로 기록에 추가됩니다. 컨텍스트 오버플로가 발생하거나, 단계당 16,000개의 토큰 제한을 초과하거나, 추론 오류가 발생하면 실행이 종료됩니다. 불완전한 실행도 다른 실행과 마찬가지로 평가됩니다. 그렇지 않은 경우, Faraday가 도구를 호출하지 않고 직접 응답하거나 지정된 실제 실행 시간 제한에 도달하면 실행이 종료됩니다.

* 프로그래밍 가능한 에이전트를 도구로 활용하기(CAT)

Faraday는 최첨단 프로그래밍 에이전트를 탑재하고 이를 도구로 활용합니다. 래퍼 스크립트는 Codex CLI를 비대화형 방식으로 실행합니다. Faraday는 셸 도구를 통해 이 스크립트를 호출하고 프로그래밍 에이전트의 명령, 출력, 메시지, 각 단계에 소요된 시간 등을 포함한 로그를 얻을 수 있습니다. 기본적으로 연속 호출 시 프로그래밍 에이전트의 이전 세션 상태를 유지하지만, Faraday는 컨텍스트를 재설정하거나 여러 프로그래밍 에이전트를 병렬로 실행할 수도 있습니다. 래퍼 스크립트는 마감 시간을 설정하며, Faraday는 각 요청에 대해 개별적으로 마감 시간을 지정할 수 있습니다. 마감 시간을 초과하면 상호 작용 로그의 일부가 반환됩니다. 프로그래밍 에이전트에서 사용하는 모델은 런타임 매개변수입니다. 대부분의 학습 과정에는 GPT-5.4 mini가 사용되고, 최종 단계와 평가에는 GPT-5.5가 사용됩니다.

훈련 후 계획

Faraday를 얻기 위해 연구진은 Replica 작업 공간을 기반으로 수정된 GRPO를 사용하여 Faraday 에이전트 프레임워크 내에서 Qwen3.6-27B를 사후 학습했습니다. LoRA 미세 조정을 랭크 128(k=128)로 적용했으며, 128K 토큰 컨텍스트 윈도우와 6 × 10⁻⁶의 고정 학습률을 사용하여 모든 선형 투영 레이어에서 어댑터를 학습했습니다. Adam 옵티마이저의 각 단계는 242개의 작업이 포함된 Replica 학습 세트 파티션에서 10개의 작업 배치를 추출하는 방식으로 진행되었으며, 각 작업은 8번의 실행에 해당합니다.

작업 샘플링 방법은 각 배치(batch)가 전체 코퍼스의 연도 범위를 고르게 포함하도록 보장하며, 동시에 각 훈련 에포크(epoch)는 각 작업에 정확히 한 번씩 접근하여 특정 과학 시대의 데이터가 특정 매개변수 업데이트에 과도하게 반영되는 것을 방지합니다.

장기 훈련 안정성

훈련 후 단계에서는 검증 불가능한 영역에서 장기간의 강화 학습이 요구되는데, 이는 훈련 불안정성과 모델 붕괴에 취약한 환경으로 알려져 있습니다. 이러한 불안정성에 기여하는 두 가지 요인은 보상 신호의 높은 분산과 균일한 점수 부여입니다. 이 문제를 해결하기 위해 연구진은 훈련 단계에서 평가자에 두 가지 수정을 가했습니다.

첫째, 이 방식은 세 번의 독립적인 평가 결과 평균을 사용하여 롤아웃 단계에서 보상을 계산합니다. 둘째, 심사위원은 롤아웃 과정에서 각 운영 라운드에 가중치를 부여하여 크레딧을 계산해야 합니다. 이러한 방식으로, 매개변수 업데이트의 전체적인 크기를 변경하지 않고도 단일 롤아웃 내에서 크레딧을 재분배할 수 있습니다.

패러데이는 과학 연구의 질적, 양적 측면 모두에서 더욱 엄격했다.

패러데이의 성능을 평가하기 전에, 실험 결과는 먼저 복제 작업 자체가 충분히 어려운 과제임을 검증했습니다.Claude Opus 4.8은 연구에서 가장 우수한 성능을 보인 기준 모델 중 하나이지만, Claude와 GPT-5.5를 포함한 주요 코딩 에이전트 중 어느 것도 복제 작업에서 포화 상태에 도달하지 못했습니다.연구 결과에 따르면 논문 발표일이 최근일수록 재현하기가 더 어렵다는 사실이 밝혀졌습니다. 특히 AI for Science 논문은 기존 머신러닝 논문보다 재현이 더 어려운 경향이 있습니다. 연구팀은 이러한 현상이 최신 논문일수록 모델 사전 학습 데이터의 정보 밀도가 낮고, 최근 연구일수록 더 많은 컴퓨팅 자원을 요구하기 때문에 적절한 규모 축소가 어렵기 때문일 수 있다고 추측합니다.

패러데이의 종이 복제 능력은 클로드와 코덱스보다 뛰어났다.

연구진은 전체 복제 작업 분포에 걸쳐 패러데이 모델과 다양한 기준 모델을 비교했습니다(아래 그림 참조).Faraday 모델은 학습 및 테스트 작업 모두에서 기본 Qwen 모델에 비해 성능이 전반적으로 향상되었습니다.분산 처리 환경에서 Faraday는 731개의 TP3T 작업에서 Claude와 Codex보다 우수한 성능을 보였으며, 분산 처리 외 환경에서는 601개의 TP3T 작업에서 Faraday가 Claude와 Codex보다 우수한 성능을 보였습니다.

패러데이의 논문은 최첨단 프로그래밍 지능형 에이전트에 비해 뛰어난 재현성을 보여줍니다.
패러데이의 논문은 최첨단 프로그래밍 지능형 에이전트에 비해 뛰어난 재현성을 보여줍니다.
심사위원의 총점을 여러 하위 항목으로 세분화하면 다음과 같은 사실이 드러납니다...Faraday는 실험적 깊이, 주장의 재현성 및 시각적 충실도 측면에서 기준 모델보다 우수한 성능을 보였으며, 과학적 진실성 및 구현 충실도 측면에서는 Claude와 유사한 성능을 보였습니다.(아래 이미지를 참조하세요.)

패러데이의 강점은 주로 실험의 깊이와 연구 결과의 재현성에 있다.
패러데이의 강점은 주로 실험의 깊이와 연구 결과의 재현성에 있다.
연구진은 패러데이의 장점이 프롬프트 단어 최적화만으로 얻어질 수 있는지 검증하기 위해 코덱스 기준 모델에 대해 24차례의 자동 프롬프트 단어 최적화를 수행하고, 최종 프롬프트 단어를 원래 코덱스 및 패러데이의 프롬프트 단어와 비교했습니다. 결과는 아래 그림에 나와 있습니다.

기본 기준 프롬프트를 사용하든, 학습 데이터 세트에 대한 한 차례의 컨텍스트 최적화를 통해 얻은 프롬프트를 사용하든, 모든 작업에서 Faraday의 평균 점수가 Codex보다 높았습니다.
기본 기준 프롬프트를 사용하든, 학습 데이터 세트에 대한 한 차례의 컨텍스트 최적화를 통해 얻은 프롬프트를 사용하든, 모든 작업에서 Faraday의 평균 점수가 Codex보다 높았습니다.
최적화된 추천 단어는 의미 있는 성능 향상을 가져오지 못했으므로 패러데이 알고리즘과의 격차는 여전히 존재합니다.최적화된 프롬프트는 결과에서 특정 실패 패턴을 식별했지만 이러한 문제를 해결하지는 못했습니다. 즉, 사후 학습으로 인한 성능 향상은 프롬프트 엔지니어링만으로 얻어지는 것은 아닌 것으로 보입니다.

패러데이는 질적 수준에서 더욱 엄격한 연구 능력을 보여주었다.

Faraday가 Claude 및 Codex 기준 모델에 비해 구체적으로 어떤 개선점을 제공하는지 이해하기 위해 연구원들은 Faraday의 점수가 Claude 및 Codex의 최고 점수를 크게 능가한 사례들을 중심으로 몇 가지 특정 결과를 수동으로 분석했습니다. 아래 표는 몇 가지 대표적인 예를 보여줍니다.

패러데이의 행동은 엄격한 과학 연구자의 행동과 더 유사하다.
패러데이의 행동은 엄격한 과학 연구자의 행동과 더 유사하다.
분석 결과 두 가지 패턴이 반복적으로 나타났습니다. 첫째, 패러데이 모델은 실험이 검증하려는 메커니즘을 진정으로 이해하는 반면, 기준 모델은 예상 출력을 직접 하드코딩하거나 지나치게 단순화된 접근 방식을 사용하여 차트에 해당하는 핵심 결론을 제대로 재현하지 못하는 경우가 많았습니다. 둘째, 패러데이 모델은 실험 범위 측면에서 더 포괄적이며, 불필요한 삭제를 피하면서 원래 실험의 내용을 더 많이 재현할 수 있었습니다.

"상상된 복제"의 일반화 능력

연구진은 또한 아래 그림과 같이 "가상의" 재현에 대한 Faraday의 일반화 능력을 평가했습니다. 이를 위해 Claude Opus 4.8에게 Replica 훈련 세트와 테스트 세트에서 각각 논문 5편을 무작위로 선택하여 각 논문에 대해 두 가지 변형을 생성하도록 요구한 후, Faraday와 Codex GPT-5.5를 이러한 작업에 대해 평가했습니다.

10개 논문에 걸쳐 20가지 가상 과제 변형을 대상으로 8번의 실행 결과, Faraday 모델은 거의 모든 과제에서 평균 scorecrit 점수 면에서 다른 모델들을 능가하는 성능을 보였습니다.
10개 논문에 걸쳐 20가지 가상 과제 변형을 대상으로 8번의 실행 결과, Faraday 모델은 거의 모든 과제에서 평균 scorecrit 점수 면에서 다른 모델들을 능가하는 성능을 보였습니다.
20개 과제 중 19개에서 심사위원들은 코덱스보다 패러데이의 결과를 더 선호했습니다. 더 자세히 말하자면, 패러데이는 최첨단 모델보다 재현성이 뛰어날 뿐만 아니라 혁신 역량 또한 더 우수함을 보여주었습니다.하지만 연구진은 자신들이 사용한 평가 척도가 '상상력' 관련 과제에 대해 검증된 적이 없으므로, 이러한 결론은 향후 연구를 통해 추가적인 검증이 필요하다고 조심스럽게 지적했습니다.

결론

과거의 인공지능 과학자들이 실험을 수행하는 엔지니어에 가까웠다면, 패러데이의 CAT 패러다임은 인공지능에 무엇을 해야 할지 판단할 수 있는 과학적 판단력을 더욱 강화하고자 합니다. 연구 방향을 결정하고, 실험 범위를 합리적으로 정의하며, 재현 가능한 결과의 신뢰성을 판단하는 능력은 일단 지능형 에이전트의 외부 레이어에 내장되면, 그 기반이 되는 최첨단 모델이 업그레이드됨에 따라 지속적으로 증폭될 수 있습니다.

더욱 중요한 것은, 이러한 패러다임이 AI 역량 개발 및 보안에 대한 새로운 통찰력을 제공한다는 점입니다. 즉, 비교적 작은 모델이 과학 연구 판단을 담당하고, 더 강력한 모델이 엔지니어링 실행을 담당하도록 하는 것입니다. 미래에는 AI 과학자들 간의 경쟁이 더 이상 모델 매개변수의 크기에 관한 것이 아니라, 더 나은 과학 연구 판단, 도구 활용, 그리고 인간-기계 협업 능력 개발에 관한 것으로 바뀔 수 있습니다.

참고문헌:

https://arxiv.org/abs/2608.13331