Command Palette
Search for a command to run...
论文
每日更新的前沿人工智能研究论文,帮助您紧跟最新的人工智能趋势
篇论文

语言模型需要睡眠:学习自我修正与记忆巩固

HunyuanOCR-1.5:让轻量级OCR视觉语言模型更快更强






























从RGB生成到稠密场读出:基于文本到图像模型的像素空间稠密预测
KronQ:基于克罗内克分解海森矩阵的大语言模型量化
信赖域策略蒸馏
视频生成模型是通用视觉学习器
面向语言智能的可扩展视觉预训练
长时程终端基准:通过密集奖励评分测试智能体在长时程终端任务上的极限
LLM-as-a-Tutor:面向不可验证强化学习的策略感知提示自适应
原子任务图:面向智能体规划与执行的统一框架
LongE2V:基于视频扩散模型的长时程事件驱动视频重建、预测与帧插值
UniClawBench:面向真实世界任务的主动式智能体通用评测基准
思想拥有基因组:科学谱系推理与基于谱系的思想生成基准评测
为何我打不开抽屉?缓解零样本组合动作识别中的物体驱动捷径
Video-Oasis:重新审视视频理解的评估
Vidu S1:一种实时交互式视频生成模型
衡量人类与LLM研究想法之间的差距
驾驭效应:编排设计如何决定企业智能体AI的代币经济学
无限世界与多样交互
面向具身智能的混合专家视频预训练扩展
LAME M-VLA:面向机器人操作的双重潜在记忆视觉-语言-动作模型
基于深度原生结构推理的精确、跨学科且透明的构效关系理解
面向全模态密集视频描述的自回归并行解码
Light-Omni:基于长期记忆的智能体视频理解中的反射优于推理
视觉作为统一多模态生成
层次化稀疏注意力正解:迈向无限上下文建模
AlayaWorld:长时程可玩视频世界生成
RynnWorld-4D:面向机器人操作的4D具身世界模型
Nemotron-Labs-3-Puzzle-75B-A9B:压缩混合专家大语言模型
基于前缀回放的多轮在线策略蒸馏
Gemma 4 技术报告
UI-MOPD:面向持续GUI智能体学习的多平台在线策略蒸馏方法