AutoSynthData generiert Trainingsdaten für Enterprise-Agents
ServiceNow CoreAI hat AutoSynthData vorgestellt, ein neuartiges Pipelinedesign zur automatischen Generierung von Trainingsdaten für Enterprise-AI-Agents. Während allgemeine Sprachmodelle oft über ausreichende Grundfähigkeiten verfügen, scheitern sie häufig an umgebungsspezifischen Restriktionen, komplexen Workflows und individuellen Datenzuständen. AutoSynthData schließt diese Lücke, indem es Fähigkeitslücken des Zielmodells systematisch analysiert und darauf basierend validierte, variationsreiche Übungsaufgaben generiert. Die Architektur des Systems operiert auf einer klaren Abstraktionsebene: Jede Aufgabe besteht aus einer Systemspezifikation, einer nutzerseitigen Prompt und einem Verifier. AutoSynthData bewertet zunächst das Zielmodell gegen diagnostische Aufgaben und leitet daraus Capability-Specification-Cards ab, die von einem stärkeren Lehrermodell validiert werden. Auf Basis dieser Karten erfolgt die Aufgabengenerierung in zwei Phasen. Im Target-Modus entstehen kontrollierte Grundstichproben, die im Multiply-Modus durch Variation von Entitäten, Startzuständen und Werkzeugkombinationen vervielfältigt werden. Um die Datenqualität sicherzustellen, durchläuft jede Kandidatin strenge Validierungsgates: Positive Verification prüft die Korrektheit der Referenzlösung, Negative Verification stellt sicher, dass falsche Zustände ausgeschlossen werden, und ein Critic-Modul leitet gezielte Reparaturen bei Fehlern ein. Auf Batch-Ebene überwacht ein Controller die Coverage und verhindert Redundanz, wodurch ein ausgewogenes Trainingsset entsteht, das sich dynamisch an den Fortschritt des Modells anpasst. Die Wirksamkeit des Ansatzes wurde im EnterpriseOps Gym evaluiert, einem kontrollierten Testumfeld für Enterprise-Agents. Im Hybrid-Domänen-Test diente das Qwen3.8-27B-Modell als Lehrer, um das Gemma-4-26B-Zielmodell zu trainieren. Innerhalb von etwa 18 Stunden wurden 2.000 synthetische Proben generiert. Das resultierende Nachschulungsmodell steigerte den Pass@1-Score um 7,2 Prozentpunkte auf 68,55 % und schloss damit 59 % der ursprünglichen Leistungslücke zum Referenzmodell. Im ITSM-Domänen-Test fungierte DeepSeek-V4.1-Flash als Lehrer; nach einer Generierungszeit von 66 Stunden für 1.994 Proben stieg der Pass@1-Score von 18,77 % auf 27,18 %. AutoSynthData demonstriert, dass gezielte, umgebungsvalidierte Synthesedaten den Trainingserfolg von Enterprise-Agents signifikant beschleunigen können. Durch die kontinuierliche Anpassung des Schwierigkeitsgrads an die aktuelle Modellgrenze bleibt das System auch nach dem Post-Training relevant. Die Architektur ist modular aufgebaut und vorbereitet für die spätere Integration in Reinforcement-Learning-Workflows. Der Ansatz etabliert damit einen skalierbaren Pfad, um die Diskrepanz zwischen allgemeinen KI-Kapazitäten und spezifischen Unternehmensanforderungen nachhaltig zu überbrücken.
