HyperAIHyperAI

Command Palette

Search for a command to run...

AutoSynthDataがエンタープライズエージェントの訓練データを生成

ServiceNow CoreAIは企業環境に特化したAIエージェントの訓練用データ生成を自動化するパイプラインAutoSynthDataを開発しその有効性を検証した。企業エージェントは社内システム業務ルールデータ状態といった固有の環境で動作する必要があるが汎用モデルでも特定のワークフローツール連携制約条件で失敗するケースが少なくない。このギャップを効率的に訓練データに変換する手法がAutoSynthDataである。 同パイプラインは対象モデルの失敗パターンを診断し高性能な教師モデルの成功事例と照合することで学習すべき能力の欠落を特定する。この知見を基に環境の制約実現可能性現実味現在のモデルにとって適切な難易度を満たす能力仕様カードを自動生成する。データ構築はコアサンプル生成と多様化展開の2段階で行われ並列処理により大規模な学習データを効率的に構築する。 生成されたタスクは厳格な検証プロセスを経て品質が担保される。参照軌跡の環境実行による正の検証と不正解状態の拒否を確認する負の検証を実施し検証子の緩さやタスクの実行不可を排除する。失敗した候補は批評エンジンによる診断と限定された修正ループで修復され最終的に学習データセットへ採用される。さらに単一タスクの品質だけでなくバッチレベルでの多様性とカバレッジをメタレビューで管理し生成リソースの最適配分を図る。この仕組みによりモデルの能力境界に近い難易度のタスクを動的に抽出し継続的な訓練曲線の向上を実現する。 検証環境にはServiceNowが提供するEnterpriseOps GymのHybridおよびITSMドメインを用いた。対象モデルにGemma-4-26B教師モデルにQwen3.8やDeepSeek-V4.1 Flashを起用し各ドメインで約2000件の合成データを生成して監督下微細調整SFTを実施した。その結果HybridドメインではPass@1が7.2ポイント相対35%向上し検証子成功率は63.01%から68.55%へ上昇。元々の参照モデルとの性能差の59%を縮小した。ITSMドメインでもPass@1は18.77%から27.18%へと明確な改善を見せた。 AutoSynthDataはモデルの進化に伴い学習対象を自動的に更新するフィードバックループを構築することで企業エージェントの訓練パイプラインの標準化に貢献する。今後は強化学習RL領域への拡張も計画されており実環境に即した高品質合成データの自動生成アプローチが次世代エンタープライズAIの実用化を加速させる可能性を秘めている。

関連リンク