HyperAIHyperAI

Command Palette

Search for a command to run...

Nemotron erringt IOI- und IMO-Gold durch Feintuning

Das von Nemotron Labs entwickelte Modellsystem hat im Jahr 2026 sowohl beim Internationalen Informatik-Olympiade (IOI) als auch bei der Internationalen Mathematik-Olympiade (IMO) Medaillen-Niveau erreicht. Die Ergebnisse demonstrieren, dass leistungsstarke Grundlagenmodelle durch gezielte Feinabstimmung und optimierte Inferenzschleifen in hochspezialisierte Lösungen für komplexe Problembereiche überführt werden können. Für die IOI 2026 wurde das Modell Nemotron-3-Ultra-CC eingesetzt, das auf einem Supervised Fine-Tuning basiert. Nach einer Kuratierung von 22.000 Programmieraufgaben und synthetischen Denkpfaden erzielte das System unter live-Wettkampfbedingungen, identisch zu den Vorgaben für menschliche Teilnehmer, 535,4 von 600 möglichen Punkten. Damit lag es deutlich über der offiziellen Gold-Marke von 361,12 sowie dem bisherigen besten menschlichen Ergebnis von 498,27. Parallel dazu konnte das Nemotron-3-Nano-CC-Modell durch die Kombination aus Feinabstimmung, Reinforcement Learning und einer iterativen GenCorrect-Strategie ebenfalls Gold-Niveau erreichen und erreichte 468 Punkte. Im Bereich der Mathematik setzte Nemotron auf eine generate-verify-refine-Inferenzschleife, die auf zwei getrennten Spezialmodellen basierte. Ein Checkpoint wurde durch Supervised Fine-Tuning mit über 414.000 qualifizierten Beweisaufgaben trainiert, während ein zweites Modell durch Reinforcement Learning optimiert wurde. Das Zusammenspiel beider Spezialmodelle mit einem allgemeinen Basismodell ermöglichte eine automatische Kandidatengenerierung, kritische Bewertung und iterative Verbesserung der Lösungsvorschläge. Ohne externe Tools oder Internetzugang erreichte das System 30 von 42 Punkten und übertraf damit offiziell die Gold-Schwelle von 29 Punkten. Die Untersuchungen zeigen, dass spezialisierte Modelle nicht nur durch rohe Trainingsdaten, sondern durch die gezielte Kombination von Feinabstimmung und rechenintensiver Testzeit-Optimierung entstehen. Die Anpassungsfähigkeit des Frameworks bestätigte sich auch im Größenvergleich: Während das Nano-Modell primär von Reinforcement Learning profitierte, reichte beim Ultra-Modell bereits eine einzelne Trainings-Epoche, um die Leistung des vollständig optimierten Nano-Modells zu übertreffen. Zur Förderung der offenen Forschung veröffentlichte das Entwicklungsteam die trainierten Checkpoints, die zugrunde liegenden Datensätze und eine neue Benchmark namens Nemotron-IMO-Bench mit 200 olympiaden-reifen Aufgaben auf Hugging Face. Zusätzlich stehen die Inferenzpipelines, Prompt-Vorlagen und Dokumentation im NeMo-Skills-Repository bereit. Die Ergebnisse untermauern die These, dass transparente, reproduzierbare Spezialisierungsverfahren die Entwicklung von Frontier-KI-Systemen vorantreiben, die in anspruchsvollen wissenschaftlichen und technischen Disziplinen mit menschlichen Expert:innen konkurrieren können.

Verwandte Links