HyperAIHyperAI

Command Palette

Search for a command to run...

印度Sarvam实验室押注开源AI:新模型挑战全球技术格局

印度AI实验室Sarvam周二在新德里举行的印度AI影响力峰会上,发布新一代大语言模型,标志着其对开源AI可行性的重大押注。该公司认为,小型、高效的开源模型有望在成本高昂的美国和中国巨头产品中抢占一席之地。 此次发布的新模型包括300亿参数和1050亿参数的两种语言模型,以及文本转语音、语音转文字和文档视觉理解模型。相比去年10月推出的20亿参数Sarvam 1模型,性能实现显著跃升。其中,300亿参数模型采用“专家混合架构”,仅在运行时激活部分参数,大幅降低计算成本。该模型支持3.2万个token的上下文窗口,适用于实时对话场景;而1050亿参数模型则支持12.8万个token,适合复杂多步骤推理任务。 Sarvam强调,这些模型均为从零开始训练,而非基于现有开源系统微调。300亿模型使用约16万亿token文本进行预训练,1050亿模型则覆盖了多类印度语言的万亿级数据。所有模型均基于印度政府“IndiaAI使命”计划提供的算力支持,由数据中心运营商Yotta提供基础设施,Nvidia提供技术协助。 Sarvam联合创始人Pratyush Kumar表示,公司不会盲目追求模型规模,而是聚焦真实应用场景,如印度本土语言的语音助手和聊天系统。他强调:“我们希望有意识地推进模型扩展,理解真正重要的任务,再针对性构建解决方案。” Sarvam计划开源300亿和1050亿参数模型,但尚未明确是否公开训练数据和完整代码。此外,公司还推出面向企业应用的“Sarvam for Work”产品线,包括编程专用模型,并打造名为Samvaad的对话式AI代理平台。 成立于2023年的Sarvam已获超5000万美元融资,投资方包括Lightspeed Venture Partners、Khosla Ventures和Peak XV Partners(原红杉印度)。此次发布,不仅展现其技术实力,也呼应印度推动本土AI发展、减少对外依赖的战略目标。

相关链接

印度Sarvam实验室押注开源AI:新模型挑战全球技术格局 | 热门资讯 | HyperAI超神经