HyperAIHyperAI

Command Palette

Search for a command to run...

Nemotron-RL-Agentic-Terminal-Pivot-v1 Datensatz Für Das Verstärkende Lernen Von Terminal-Agenten

Datum

Organisation

NVIDIA

Lizenz

CC BY 4.0

Nemotron-RL-Agentic-Terminal-Pivot-v1 ist ein von NVIDIA im Jahr 2026 veröffentlichtes Reinforcement-Learning-Datensatz für Terminal-Agenten, der darauf abzielt, große Sprachmodelle mit Trainingsdaten für das Reinforcement Learning in Szenarien zur Interaktion über Terminals (Kommandozeile) zu versorgen. Dieser Datensatz wurde speziell für die Umgebung terminus_judge von NeMo Gym entwickelt und kann zum nachgelagerten Training durch Reinforcement Learning, zum überwachten Feinabstimmen oder zur offline Verhaltensanalyse von Agenten verwendet werden.

Der Datensatz umfasst 31.111 Trainingsbeispiele, die aus 630 ATCB-Saatgutaufgaben und 2.716 verschiedenen Quelltrajektorien stammen. Die Aufgabenszenarien decken langfristige Terminaloperationen in Bereichen wie Industriesysteme, Hochleistungsrechnungscluster, Gesundheitswesen, Finanzsektor und Medienarchivierung ab, darunter Aufgaben wie der Aufbau von Datenpipelines, Fehleraudits, Dienstdiagnosen sowie Sicherheits- und Compliance-Prozesse. Bei den Beispielen pro Aufgabe beträgt der Medianwert 45. Jedes Beispiel besteht aus einem einzelnen Entscheidungspunkt eines Agenten, der aus einer Trajektorie extrahiert wurde, bei welcher die Endaufgabe erfolgreich abgeschlossen wurde. Dies beinhaltet eine Aufgabenanweisung, einen referenziellen nächsten Schritt, generiert vom Terminuss-2-Agenten unter Verwendung des GLM-5.1 als Lehrermodell, sowie Routinginformationen zur Belohnungsbewertung. Die durchschnittliche Länge der Aufgabenanweisungen beträgt etwa 39.900 Zeichen, während der referenzielle nächste Schritt durchschnittlich ca. 970 Zeichen lang ist.

Datenvelder:

  • responses_create_params.input: Prompt, enthält die Anweisung zur Aufgabe sowie die Historie der Terminalinteraktionen bis hin zum Entscheidungszeitpunkt
  • expected_answer: Referenzierter nächster Schritt des Agenten an diesem Punkt
  • agent_ref: Routinginformation, die auf den Ressourcen-Server von NeMo Gym terminus_judge verweist; dient der Bewertung von Aktionen durch das Politikmodell und der Generierung von RL-Belohnungen
  • metadata: Metadatenobjekt mit fünf Unterfeldern; interne Erfassungskennzeichnungen und Infrastrukturinformationen wurden entfernt

KI mit KI entwickeln

Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.

KI-gestütztes kollaboratives Programmieren
Sofort einsatzbereite GPUs
Die besten Preise

HyperAI Newsletters

Abonnieren Sie unsere neuesten Updates
Wir werden die neuesten Updates der Woche in Ihren Posteingang liefern um neun Uhr jeden Montagmorgen
Unterstützt von MailChimp