HyperAIHyperAI

Command Palette

Search for a command to run...

テーブル型LLMが従来手法を突破する

表データ予測分野において、従来の勾配ブースティング木を凌駕する表データ用ファウンデーションモデルが台頭している。インリアSODAチームのTabICLv2は2026年7月15日時点のTabArenaベンチマークで単一モデル最高峰に位置し、チューニング済みGBDTを150ポイント以上引き離した。TabICLv2は約2800万パラメータで勾配降下を一切行わずコンテキスト学習によりゼロショット推論を行う。完全オープンライセンスで合成データのみ事前学習したためデータリークが排除され、著者はAWS A10G環境で約2ドルで公式スコアを再現し一致を確認した。 性能特性には明確な棲み分けがある。100特徴量以下の標準テーブルでは推論速度も優れるが、高次元データや高多重度カテゴリではチューニング済みGBDTが優位性を維持する。複数のファウンデーションモデルを検証誤差で選択するルーティング手法により単一モデルを上回る精度が実証された。一方GBDTとの混合選択は検証誤差の比較困難さから逆効果となる。 リーダーボード首位のGoogle TabFMは高い数値を示すものの技術論文の非公開と非商用ライセンスのため独立検証が不可能である。本動向は機械学習パイプラインの再定義を促しており、データ特性に応じたモデル選択が求められている。高次元データでのアンサンブル最適化が次の課題となる。

関連リンク