NVIDIA开源数据与合成技术赋能AI智能体
英伟达近日强调,构建具备真实世界应对能力的AI智能体核心在于高质量数据而非单纯依赖模型权重。针对智能体在API调用、多步推理与工作流恢复等方面的复杂性,英伟达通过Nemotron开源数据集与合成数据技术提供关键支撑。公司近期在国际机器学习大会展示相关成果,近145篇论文已引用Nemotron模型与数据集。 为提升数据透明度与模型可解释性,英伟达开放了逾十万亿预训练令牌及数百万条后训练样本,并同步推出交互式探索工具Nemotron Post-Training v3 Prompt Atlas,助力开发者精准定位编码、安全及智能体行为数据分布。面向多语言与地域文化差异,公司利用NeMo工具链生成Nemotron-Personas合成人格数据。该数据集近期在巴黎VivaTech大会更新第十个区域版本,已覆盖超24亿人口特征,有效解决本地化语境下的交互适配难题。 英伟达应用深度学习研究副总裁Bryan Catanzaro指出,合成数据使企业能够在不暴露核心业务机密的前提下共享高价值信号,从而打破行业数据孤岛。通过建立严格的数据溯源、评估与人类审核机制,该技术正重塑机构间的信任边界。随着人工智能向复杂系统演进,开放数据生态与标准化合成数据管线已成为推动智能体技术规模化落地与产学研协同创新的核心基础设施。
