Command Palette
Search for a command to run...
论文
每日更新的前沿人工智能研究论文,帮助您紧跟最新的人工智能趋势
篇论文

语言模型推理中的带重置的信用分配

Unlimited OCR:欢迎一次性长期解析的时代






























PlanBench-XL:评估大语言模型工具使用智能体在大规模工具生态系统中的长程规划
OpenRath:面向 Agent 系统的会话中心运行时状态
EvoEmbedding:面向长上下文检索与智能体记忆的可进化表示
从自身错误中学习:构建用于自蒸馏的可学习微反思轨迹
世界动作模型:综述
KaLM-Reranker-V1:用于压缩文档重排序的快速但非晚期交互
重新审视大语言模型 FP4 预训练中的收缩偏差:几何起源、系统性影响及 UFP4 方案
HydraHead:从头部级功能异质性到专用注意力混合
3DCodeBench: 基于代码的 Agentic 过程化 3D 建模基准测试
RadImageNet-VQA:用于放射学视觉问答的大规模CT和MRI数据集
使用 SWE-Gym 训练软件工程智能体与验证器
MAKIEVAL:一种基于多语言自动WiKIdata的LLMs文化意识评估框架
GeneralVLA-2:几何感知重建与受控记忆用于机器人规划
多轮反思掩码在掩码扩散模型中激发推理
BrainG3N:一种用于可控3D脑部MRI生成的双用途分词器
GateMem: 多委托人共享记忆 Agents 中的记忆治理基准测试
MemSlides:一种用于个性化幻灯片生成并支持多轮局部修订的分层记忆驱动 Agent 框架
PerceptionDLM:基于多模态扩散语言模型的并行区域感知
用于通用游戏玩的代码世界模型
超越静态排行榜:用于评估 LLM Agents 的预测效度
S-Agent:空间工具使用激发空间智能推理
Multi-LCB:将LiveCodeBench扩展至多种编程语言
玩耍式智能体机器人学习
DragMesh-2:面向铰接物体的物理合理灵巧手-物交互
Moebius:具有10B级性能的0.2B轻量级图像修复框架
EfficientRollout:用于强化学习 rollout 的系统感知自投机解码
信任正确的教师:面向 GUI 定位的质量感知自蒸馏
强化空间视觉语言模型中的双路径推理
SAE 干预并不可靠:干预后抑制行为的恢复
Kairos:面向物理人工智能的原生世界模型栈