HyperAIHyperAI

Command Palette

Search for a command to run...

InfinityInstruct-3M Veröffentlicht Zehn Millionen Feinabstimmungsdatensätze

InfinityInstruct ist ein groß angelegtes, hochwertiges Open-Source-Projekt zur Feinabstimmung von Datensätzen für Anweisungen, das von der Beijing Academy of Artificial Intelligence (BAAI) ins Leben gerufen wurde. Das Ziel dieses Projekts besteht darin, einen Datensatz mit Millionen von Anweisungen zu entwickeln, um die Anweisungsverfolgungsfunktionen für große Sprachmodelle zu unterstützen und dadurch die Modellleistung zu verbessern. Bei dieser Version handelt es sich um den InfinityInstruct-3M-Befehlsdatensatz. Die endgültige Version wird voraussichtlich Ende Juni veröffentlicht.

Zu den Funktionen von InfinityInstruct gehören:

  1. Große Datensätze:Das Projekt plant die Veröffentlichung von mehreren zehn Millionen Befehlsdaten. In der ersten Phase wurden bereits 3 Millionen chinesische und englische Befehlsdaten veröffentlicht.
  2. Hochwertiges Screening:Das Zhiyuan Research Institute führt Feldanalysen und Qualitätsprüfungen an vorhandenen Open-Source-Daten durch, um den hohen Wert der Daten sicherzustellen, und ergänzt die Daten in Bereichen, in denen es an Daten mangelt.
  3. Beiträge der Open Source-Community: Während des Datensatzerstellungsprozesses stellte die Open-Source-Community eine große Menge an Anweisungsdaten bereit, darunter Datensätze aus mehreren Quellen, wie OpenHermes-2.5, UltraInteract_sft, CodeBagel usw.
  4. Risikobewertung und Datengenerierung: Das Projektteam führt derzeit eine Risikobewertung und Datengenerierung durch und erwartet, die endgültige Version mit 10 Millionen Anweisungen bis Ende Juni zu veröffentlichen.
  5. Leistungsverbesserungen: Der aktuelle Open-Source-Datensatz mit 3 Millionen Anweisungen hat SFT-Datenfunktionen (Supervised Fine-Tuning) gezeigt, die vorhandene Datensätze wie Mistral und Openhermes übertreffen.
  6. Zukunftsaussichten: Es wird erwartet, dass das auf der Grundlage des Datensatzes zur Feinabstimmung von Anweisungen trainierte Dialogmodell das Niveau von GPT-4 erreichen kann, nachdem das Datenvolumen auf mehrere zehn Millionen angestiegen ist. Die Entwicklung und Veröffentlichung des InfinityInstruct-Datensatzes ist von großer Bedeutung für die Förderung der Forschung und Anwendung groß angelegter Sprachmodelle. Es bietet umfangreiche Anweisungsdaten für große Modelle und trägt dazu bei, die Fähigkeit des Modells zu verbessern, Anweisungen zu verstehen und auszuführen. Gleichzeitig fördert sein Open-Source-Charakter auch die Zusammenarbeit und den Wissensaustausch in der KI-Community.

Zitat

@misc{li2025infinityinstructscalinginstruction,
title={Infinity Instruct: Scaling Instruction Selection and Synthesis to Enhance Language Models},
author={Jijie Li and Li Du and Hanyu Zhao and Bo-wen Zhang and Liangdong Wang and Boyan Gao and Guang Liu and Yonghua Lin},
year={2025},
eprint={2506.11116},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2506.11116},
}
@misc{du2025infinityinstructsubject,
title={Scaling Towards the Information Boundary of Instruction Sets: The Infinity Instruct Subject Technical Report},
author={Li Du, Hanyu Zhao, Yiming Ju, Tengfei Pan},
year={2025},
eprint={2507.06968},
archivePrefix={arXiv},
primaryClass={cs.AI},
url={https://arxiv.org/abs/2507.06968},
}
@article{zhao2024iidoptimizinginstructionlearning,
title={Beyond IID: Optimizing Instruction Learning from the Perspective of Instruction Interaction and Dependency},
author={Hanyu Zhao and Li Du and Yiming Ju and Chengwei Wu and Tengfei Pan},
year={2024},
eprint={2409.07045},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2409.07045},
}
@misc{zhang2024inifinitymath,
title={InfinityMATH: A Scalable Instruction Tuning Dataset in Programmatic Mathematical Reasoning},
author={Bo-Wen Zhang and Yan Yan and Lin Li and Guang Liu},
year={2024},
eprint={2408.07089},
archivePrefix={arXiv},
primaryClass={cs.LG},
url={https://arxiv.org/abs/2408.07089},
}
InfinityInstruct-3M.torrent
Seeding 1Downloading 0Completed 281Total Downloads 351
  • InfinityInstruct-3M/
    • README.md
      2.44 KB
    • README.txt
      4.88 KB
      • data/
        • Infinity-Instruct.zip
          2.79 GB

KI mit KI entwickeln

Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.

KI-gestütztes kollaboratives Programmieren
Sofort einsatzbereite GPUs
Die besten Preise

HyperAI Newsletters

Abonnieren Sie unsere neuesten Updates
Wir werden die neuesten Updates der Woche in Ihren Posteingang liefern um neun Uhr jeden Montagmorgen
Unterstützt von MailChimp
InfinityInstruct-3M Veröffentlicht Zehn Millionen Feinabstimmungsdatensätze | Datensätze | HyperAI