低価格GPTモデルのコードレビュー精度を検証
AIコードレビューにおける低コストモデルと高精度モデルの比較評価が行われた。オープンAI系モデル「GPT-5.6 Luna」と「GPT-6 Astra」を、AI-Code-Review-Evalsが公開する50件の公開Pull Requestを対象にベンチマーク調査した。調査結果は、コスト効率とバグ検知精度の明確なトレードオフを示している。 テストはCal.com、Sentry、Discourse、Keycloak、Grafanaの各プロジェクトから抽出したPRを対象に、両モデルに同一のプロンプトを適用し、正確性、セキュリティ、競合条件などを評価対象とした。結果、Lunaは50件のレビューで総コスト0.20ドル、Astraは5.66ドルとなり、1件あたりのレビューコストは約28倍の開きがある。精度面では、Lunaは93件の指摘中69件(74%)が検証済みバグとして認定され、Astraの96件中92件(96%)を下回った。Lunaが検知した検証済みバグ数はAstraの約75%相当で、1件あたりの検証コストはLunaが約0.003ドル、Astraが約0.061ドルとなった。 特にセキュリティや認証・認可ロジックを扱うKeycloakのPRでは、Lunaの検知率が大きく低下し、Astraとの差が顕著になった。これは単なる差分レビューが文脈情報を持たないことが要因であり、権限パスやログインフローの修正には高精度モデルの適用が不可欠であることを示している。一方でLunaはデータ処理や論理バグの検出ではAstraと互角の性能を発揮し、日常の一般的なコードレビューには十分実用可能なコスト性能を持つ。 両モデルを併用した場合、検証済みバグの143件中117件(82%)を5.86ドルで検知可能である。調査チームは、ルーチンワークはLunaで処理し、セキュリティ敏感領域や複雑な権限修正はAstraに振り分けるモデルルーティング戦略を推奨している。本調査は2026年9月に実施され、検証プロセスはGPT-6 AstraとGPT-5.6 Solの二段階判定を採用し、再現性が高くオープンな方法論で公開されている。開発チームは自社のPR履歴を用い、バグクラス毎にコストと精度を分離評価する手法が効果的だと指摘している。
