Command Palette
Search for a command to run...
27B AIの科学者論文再現能力がGPT-5.5/Claude Opus 4.8を凌駕。ファラデーは長期的な科学イノベーションを探求する。

研究論文の再現性は、科学的知識体系の礎石である。それは既存の研究結果の信頼性を保証するだけでなく、さらなる実験の基礎を提供する。
しかし、現在、様々な科学分野、特に機械学習は「再現性の危機」に直面している。理論的には、大規模言語モデル(LLM)に基づくAIエージェントは、この危機に対する拡張可能な解決策を提供できる可能性がある。しかし実際には、再現性は既存のAIエージェントにとって主に3つの課題となっている。初め、定義上、論文を再現する際の問題点は、情報が不完全であることだ。つまり、論文は発見に至った研究過程全体を非可逆的に圧縮した情報しか提供しないため、必然的にいくつかの詳細が省略されることになる。第二に、既存のAIエージェントは主に明確に定義された閉じた問題に対して集中的に訓練されているが、論文の複製にはエージェントがオープンエンドな探索を行う必要がある。さらに、一般的な複製タスクには、継続的な「向上」最適化に使用できる明確な報酬関数が存在しない。
この課題に対応して、Inherent Labsの研究チームは、科学研究論文を再現できるAI科学者エージェント「Faraday」を育成した。このLLMベースのエージェントは、人間のAI研究者がプログラムされたエージェントを使用するのと同様に、Codex GPT-5.5をツールとして使用します。基準ベースの評価者による評価では、Faradayは73%のインディストリビューション機械学習タスクと60%のホールドアウトAI for Scienceタスクにおいて、Claude Opus 4.8とGPT-5.5を上回る性能を示しました。
注目すべきは、Faradayのパラメータ数はわずか270億個であるにもかかわらず、5兆個のパラメータを持つモデルを制御できるため、この大規模モデルを単独で使用した場合と比較して、実質的に大幅な性能向上を実現できる点である。単一の実行結果の定性分析から、Faradayはより科学的に妥当なアプローチを採用していることが分かる。
関連する研究成果は、「AI科学者に研究を再現させるためのトレーニング」と題され、arXivにプレプリントとして公開されている。
研究のハイライト:
* この研究では、1990年から2026年までの機械学習および科学のためのAIに関する100の論文から、310のグラフ再現タスクを含む自動生成されたタスク空間を構築しました。
* 本研究では、長期にわたる検証不可能なタスクに適した、安定したGRPO(グループ応答最適化)の事後学習手法を提案する。この手法は、各タスクに対する評価基準評価器、複数サンプルの評価結果の集約、およびラウンドごとのクレジット配分メカニズムを含む。
* 本研究では、コーディングエージェントをツールとして使用できる270億個のパラメータを持つエージェント(CAT)を訓練しました。定量的および定性的な実験により、ファラデーはより高い科学的厳密性を示すことが明らかになりました。
用紙のアドレス:
https://hyper.ai/papers/2608.13331
自動生成されたタスクスペースのレプリカを作成する
ファラデーを訓練するために、研究者たちはレプリカと呼ばれる拡張可能なタスク空間を構築した。 レプリカタスク空間は、242のトレーニングタスクと68のテストタスクで構成されており、これらは100の著名な機械学習(ML)および科学のためのAIに関する論文から抽出されています。各タスクでは、エージェントは論文から結果図を再現する必要があります。エージェントは図のマスキング処理後の元の論文を入手できますが、60分の時間制限があり、H200 GPUの1/7 MIGスライスしか使用できません。
このシステムは、有用な研究ライブラリがあらかじめ読み込まれたコンテナ化された環境をエージェントに提供し、インターネットアクセス、システムプロンプト、タスクプロンプトも提供します。論文中の実験が割り当てられた時間内に完了できない場合、プロンプトはエージェントに対し、実験を完了する前に、元の実験にできる限り忠実に規模を拡大するよう指示します。
* トレーニング課題は、1990年から2026年の間に発表された機械学習に関する論文から抽出されています。
* テスト課題は、2012年から2026年の間に発表された「科学のためのAI」に関する論文から抽出されています。
これらのタスクはすべて自動生成されるため、タスク空間全体の拡張性が高いことに留意すべきです。システムは、与えられた論文を、Gemini 2.5 Pro によって駆動される 3 つの視覚言語処理段階を経てタスクに変換します。まず、スキャン段階で、テキスト内のすべての図とそのキャプションを識別します。次に、ローカリゼーション段階で、LLM バリデーターの修復ループで図のバウンディング ボックスを決定します。最後に、図は PDF から不可逆的にマスクされます。完全なタスクは、キャプション、抽出された元の図 (「ゴールド プロット」)、および図がマスクされた論文の 3 つの部分で構成されます。
研究チームは各タスクを手作業で確認し、グラフの網羅性が不十分なもの、結果グラフではないもの、キャプションが間違っているものなど、品質の低いタスクを除外します。各論文は1~13個の課題を提供し、中央値は2個である。
長期的かつ検証不可能なタスクに適した、安定したGRPO事後学習法
シンプルなエージェントフレームワーク
エージェントハーネスは、大規模言語モデル(LLM、入力と出力の両方がトークン)と環境(入力アクション/出力状態)との間のインターフェースを提供します。
* 利用可能な機能と状況
エージェントは、`apply_patch`、`read_file`、`list_dir`、`grep_files`、`shell` の 5 つの関数呼び出しを通じて操作を実行します。Faraday は shell ツールを使用してバックグラウンド プロセスを現在のセッションから切り離し、複数のコマンドを並列実行しながら複数の操作ラウンドを実行できます。ラウンド内のツール呼び出しは同時に実行され、その結果は呼び出された順序で履歴に追加されます。コンテキスト オーバーフローが発生した場合、ラウンドあたりのトークン制限である 16K を超えた場合、または推論エラーが発生した場合は、実行が終了します。不完全な実行も他の実行と同様に評価されます。それ以外の場合は、Faraday がツールを呼び出さずに直接応答した場合、または指定された実際の実行時間制限に達した場合に実行が終了します。
* プログラム可能なエージェントをツールとして使用する(CAT)
Faraday は最先端のプログラミング エージェントを搭載しており、それをツールとして使用します。ラッパー スクリプトは、Codex CLI を非対話的に実行します。Faraday はシェル ツールを介してこのスクリプトを呼び出し、プログラミング エージェントのコマンド、出力、メッセージ、および各ステップにかかった時間を含むログを取得できます。デフォルトでは、連続する呼び出しはプログラミング エージェントの以前のセッション状態を使用して継続されますが、Faraday はコンテキストをリセットしたり、複数のプログラミング エージェントを並列で実行したりすることもできます。ラッパー スクリプトは期限を強制し、これはリクエストごとに Faraday が個別に設定できます。期限を超過した場合、インタラクションの部分的なログが返されます。プログラミング エージェントで使用されるモデルはランタイム パラメータです。トレーニング プロセスの大半では GPT-5.4 mini が使用され、最終段階と評価中は GPT-5.5 が使用されます。
研修後の制度
Faradayを取得するために、研究者らはレプリカタスク空間に基づく修正GRPOを使用して、Faradayエージェントフレームワーク内でQwen3.6-27Bを事後学習させた。彼らはランク128(k = 128)のLoRAファインチューニングを採用し、128Kトークンコンテキストウィンドウと6 × 10⁻⁶の固定学習率を使用して、すべての線形射影レイヤーでアダプタをトレーニングした。Adamオプティマイザの各ステップでは、242タスクを含むレプリカトレーニングセットパーティションから10タスクのバッチを抽出し、各タスクは8回の実行に対応する。
タスクサンプリング方式により、各バッチがコーパスの全期間を均等にカバーすることが保証されます。同時に、各トレーニングエポックでは各タスクに正確に1回アクセスするため、特定のパラメータ更新において特定の科学期間のデータが支配的になることを回避できます。
長期的なトレーニングの安定性
トレーニング後には、検証不可能な領域での長期的な強化学習が必要となるが、この設定はトレーニングの不安定性やモデルの崩壊を引き起こしやすいことが知られている。この不安定性の一因として、報酬信号のばらつきが大きいことと、クレジットの割り当てが均一であることが挙げられる。この問題に対処するため、研究者らはトレーニング段階で評価器に2つの変更を加えた。
まず、ロールアウトレベルでの報酬を計算するために、3つの独立した評価結果の平均値を使用します。次に、ロールアウト中の各操作ラウンドにクレジットを割り当てるために、審査員がラウンドごとの重みを生成する必要があります。このようにして、パラメータ更新の全体的な規模を変更することなく、単一のロールアウト内でクレジットを再配分できます。
ファラデーは、科学研究の質的側面と量的側面の両方において、より厳密なアプローチをとった。
ファラデーの能力を評価する前に、まず実験結果によって、レプリカタスク自体が十分に難易度が高いことが確認された。Claude Opus 4.8は、この研究における最も優れた性能を持つベースラインモデルの1つですが、ClaudeやGPT-5.5を含む主要なコーディングエージェントはいずれも、レプリカタスクにおいて飽和状態に達していません。この研究では、論文の発表日が新しいほど再現が難しくなることも明らかになった。科学分野におけるAIに関する論文は、一般的に従来の機械学習に関する論文よりも再現が難しい。研究チームは、これは新しい論文ではモデルの事前学習データにおける情報密度が低いこと、また最近の研究は通常より多くの計算リソースを必要とするため、適切なスケールダウンを実現するのが難しくなることと関連している可能性があると推測している。
ファラデーの論文再現能力は、クロードやコーデックスよりも優れている。
研究者たちは、レプリカタスクの分布全体にわたって、ファラデーをさまざまなベースラインモデルと比較した(下図参照)。Faradayの性能は、トレーニングタスクとテストタスクの両方において、ベースとなるQwenモデルと比較して大幅に向上している。分散タスクにおいては、Faradayは73%タスクでClaudeとCodexを上回る性能を発揮し、分布外タスクにおいては、Faradayは60%タスクでClaudeとCodexを上回る性能を発揮する。

審査員の総合得点をさらに細分化して様々なサブディメンションに分解すると、以下のことが明らかになる。ファラデーは、実験の深さ、主張の再現性、視覚的な忠実度においてベースラインモデルを上回り、科学的整合性と実現の忠実度においてはクロードと同等の性能を示した。(下の画像をご覧ください。)

ファラデーの利点がプロンプト語の最適化のみによって得られるかどうかを検証するため、研究者らはCodexベースラインモデルに対して24回の自動プロンプト語最適化を行い、最終的なプロンプト語を元のCodexおよびファラデーと比較した。結果を以下の図に示す。

最適化された候補語は、目立った性能向上にはつながらなかったため、ファラデーとの差は依然として存在する。最適化されたプロンプトは結果における特定の失敗パターンを特定したが、これらの問題を解決するものではなかった。つまり、事後トレーニングによってもたらされるパフォーマンスの向上は、プロンプトの設計のみによって得られるものではないようだ。
ファラデーは、定性的なレベルにおいて、より厳密な研究能力を発揮した。
ファラデーがクロードとコーデックスのベースラインモデルと比較してどのような具体的な改善点を実現しているかを理解するために、研究者らはいくつかの具体的な結果を手動で分析し、ファラデーのスコアラーのスコアがクロードとコーデックスの最高スコアを大幅に上回ったケースに焦点を当てました。以下の表は、代表的な例を示しています。

分析の結果、2つのパターンが繰り返し明らかになった。1つ目は、Faradayモデルは実験が検証しようとしているメカニズムを真に実現しているのに対し、ベースラインモデルは期待される出力を直接ハードコーディングしたり、過度に単純化されたアプローチに頼ったりすることが多く、チャートに対応する核心的な結論を真に再現できていない点である。2つ目は、Faradayモデルは実験範囲の点でより包括的であり、不必要な削除を避けつつ、元の実験の内容をより多く再現できる点である。
「想像上の複製」の一般化能力
研究者らはさらに、ファラデーの「架空の」再現に対する汎化能力を評価した(下図参照)。クロード・オーパス4.8に、レプリカのトレーニングセットとテストセットの両方からランダムに5つの論文を選択し、各論文に対して2つのバリアントを生成するように指示し、その後、これらのタスクでファラデーとコーデックスGPT-5.5を評価した。
20の課題のうち19の課題において、審査員はコーデックスよりもファラデーの成果を高く評価した。より弱い意味では、ファラデーは最先端モデルよりも優れた再現性を示しただけでなく、より強力な革新能力も示した。しかし、研究者らは、彼らの評価尺度は「想像力を要する」課題に対してはこれまで妥当性が検証されていないため、この結論は今後の研究でさらに検証する必要があると慎重に指摘した。
結論
過去のAI研究者が実験を行うことができるエンジニアのような存在だったとすれば、ファラデーのCATパラダイムは、AIに何をするべきかを判断するための科学的判断力をさらに強化しようとするものである。研究の方向性を決定し、実験の範囲を適切に定義し、再現可能な結果の信頼性を判断する能力は、いったんインテリジェントエージェントの外層に組み込まれると、基盤となる最先端モデルがアップグレードされるにつれて、継続的に強化される。
さらに重要なことに、このパラダイムはAI機能の開発とセキュリティに関する新たな洞察も提供します。比較的小規模なモデルで科学研究の判断を、より強力なモデルでエンジニアリングの実行を担うことが可能になるのです。将来的には、AI研究者間の競争はモデルパラメータの規模だけではなくなり、より優れた科学研究の判断、ツールの活用、そして人間と機械の協働能力の開発へとシフトしていくでしょう。
参考文献:








