Command Palette
Search for a command to run...
论文
每日更新的前沿人工智能研究论文,帮助您紧跟最新的人工智能趋势

原子任务图:面向智能体规划与执行的统一框架

LongE2V:基于视频扩散模型的长时程事件驱动视频重建、预测与帧插值































原子任务图:面向智能体规划与执行的统一框架

LongE2V:基于视频扩散模型的长时程事件驱动视频重建、预测与帧插值






























UniClawBench:面向真实世界任务的主动式智能体通用评测基准
思想拥有基因组:科学谱系推理与基于谱系的思想生成基准评测
为何我打不开抽屉?缓解零样本组合动作识别中的物体驱动捷径
Video-Oasis:重新审视视频理解的评估
Vidu S1:一种实时交互式视频生成模型
衡量人类与LLM研究想法之间的差距
驾驭效应:编排设计如何决定企业智能体AI的代币经济学
无限世界与多样交互
面向具身智能的混合专家视频预训练扩展
LAME M-VLA:面向机器人操作的双重潜在记忆视觉-语言-动作模型
基于深度原生结构推理的精确、跨学科且透明的构效关系理解
面向全模态密集视频描述的自回归并行解码
Light-Omni:基于长期记忆的智能体视频理解中的反射优于推理
视觉作为统一多模态生成
层次化稀疏注意力正解:迈向无限上下文建模
AlayaWorld:长时程可玩视频世界生成
RynnWorld-4D:面向机器人操作的4D具身世界模型
Nemotron-Labs-3-Puzzle-75B-A9B:压缩混合专家大语言模型
基于前缀回放的多轮在线策略蒸馏
Gemma 4 技术报告
UI-MOPD:面向持续GUI智能体学习的多平台在线策略蒸馏方法
Wan-Streamer v0.2:更高分辨率,相同延迟
EVA-Client:面向真实机器人部署、评估与数据采集的统一框架
GigaWorld-1:构建面向机器人策略评估的世界模型路线图
ResearchStudio-Idea:基于机器学习会议成果的证据驱动研究构思技能套件
ResearchStudio-Reel:打通从论文到海报、视频和博客的科研传播最后一公里自动化
FINAL Bench:评估大语言模型的功能性元认知推理能力
SceneFun3D:三维场景中的细粒度功能与可供性理解
TheoremGraph:桥接形式化与非形式化数学
始终在线智能体:大语言模型智能体的持久记忆、状态与治理综述
UniClawBench:面向真实世界任务的主动式智能体通用评测基准
思想拥有基因组:科学谱系推理与基于谱系的思想生成基准评测
为何我打不开抽屉?缓解零样本组合动作识别中的物体驱动捷径
Video-Oasis:重新审视视频理解的评估
Vidu S1:一种实时交互式视频生成模型
衡量人类与LLM研究想法之间的差距
驾驭效应:编排设计如何决定企业智能体AI的代币经济学
无限世界与多样交互
面向具身智能的混合专家视频预训练扩展
LAME M-VLA:面向机器人操作的双重潜在记忆视觉-语言-动作模型
基于深度原生结构推理的精确、跨学科且透明的构效关系理解
面向全模态密集视频描述的自回归并行解码
Light-Omni:基于长期记忆的智能体视频理解中的反射优于推理
视觉作为统一多模态生成
层次化稀疏注意力正解:迈向无限上下文建模
AlayaWorld:长时程可玩视频世界生成
RynnWorld-4D:面向机器人操作的4D具身世界模型
Nemotron-Labs-3-Puzzle-75B-A9B:压缩混合专家大语言模型
基于前缀回放的多轮在线策略蒸馏
Gemma 4 技术报告
UI-MOPD:面向持续GUI智能体学习的多平台在线策略蒸馏方法
Wan-Streamer v0.2:更高分辨率,相同延迟
EVA-Client:面向真实机器人部署、评估与数据采集的统一框架
GigaWorld-1:构建面向机器人策略评估的世界模型路线图
ResearchStudio-Idea:基于机器学习会议成果的证据驱动研究构思技能套件
ResearchStudio-Reel:打通从论文到海报、视频和博客的科研传播最后一公里自动化
FINAL Bench:评估大语言模型的功能性元认知推理能力
SceneFun3D:三维场景中的细粒度功能与可供性理解
TheoremGraph:桥接形式化与非形式化数学
始终在线智能体:大语言模型智能体的持久记忆、状态与治理综述