Command Palette
Search for a command to run...
论文
每日更新的前沿人工智能研究论文,帮助您紧跟最新的人工智能趋势

MMR1:通过方差感知采样与开放资源增强多模态推理

基于方差的课程强化学习用于大语言模型































MMR1:通过方差感知采样与开放资源增强多模态推理

基于方差的课程强化学习用于大语言模型






























MultiEdit:在多样且具有挑战性的任务上推进基于指令的图像编辑
BRISC:基于Swin-HAFNet的脑肿瘤分割与分类标注数据集
FDABench:面向异构数据上分析查询的数据Agent基准测试
作画易,思辨难:文本到图像模型能否铺就舞台,却无法主导演出?
UniVerse-1:通过专家拼接实现统一的音视频生成
基础模型在逐步具身推理中的表现如何?
脉冲脑技术报告:脉冲脑启发的大规模模型
SAGE:语义理解的现实基准
WAVECLIP:小波Token化用于自适应分辨率CLIP
EmbeddingGemma:强大且轻量的文本表示
通过GRPO提升语音感知语言模型中的语音理解能力
VLMs 距离视觉空间智能还有多远?一项基准驱动的视角
SIM-CoT:监督式隐式思维链
SWE-QA:语言模型能否回答仓库级代码问题?
视频模型是零样本学习者和推理者
用于机械工程分析问题关键求解的N-Plus-1 GPT Agent
Memory-QA:基于多模态记忆的回忆问答
MAPO:混合优势策略优化
Hyper-Bagel:一种用于多模态理解与生成的统一加速框架
预训练数据上的强化学习
视觉运动策略中是否需要本体感觉状态?
Baseer:用于阿拉伯文文档到Markdown OCR的视觉-语言模型
GenExam:跨学科文本到图像测评
Nav-R1:具身场景中的推理与导航
MoEs 比你想象的更强大:基于 RoE 的超并行推理扩展
ARE:扩展Agent环境与评估
DiffusionNFT:基于前向过程的在线扩散强化
TempSamp-R1:面向视频LLM的强化微调有效时间采样
OnePiece:将上下文工程与推理引入工业级级联排序系统
OmniInsert:通过扩散Transformer模型实现无掩码的任意参考视频插入
MultiEdit:在多样且具有挑战性的任务上推进基于指令的图像编辑
BRISC:基于Swin-HAFNet的脑肿瘤分割与分类标注数据集
FDABench:面向异构数据上分析查询的数据Agent基准测试
作画易,思辨难:文本到图像模型能否铺就舞台,却无法主导演出?
UniVerse-1:通过专家拼接实现统一的音视频生成
基础模型在逐步具身推理中的表现如何?
脉冲脑技术报告:脉冲脑启发的大规模模型
SAGE:语义理解的现实基准
WAVECLIP:小波Token化用于自适应分辨率CLIP
EmbeddingGemma:强大且轻量的文本表示
通过GRPO提升语音感知语言模型中的语音理解能力
VLMs 距离视觉空间智能还有多远?一项基准驱动的视角
SIM-CoT:监督式隐式思维链
SWE-QA:语言模型能否回答仓库级代码问题?
视频模型是零样本学习者和推理者
用于机械工程分析问题关键求解的N-Plus-1 GPT Agent
Memory-QA:基于多模态记忆的回忆问答
MAPO:混合优势策略优化
Hyper-Bagel:一种用于多模态理解与生成的统一加速框架
预训练数据上的强化学习
视觉运动策略中是否需要本体感觉状态?
Baseer:用于阿拉伯文文档到Markdown OCR的视觉-语言模型
GenExam:跨学科文本到图像测评
Nav-R1:具身场景中的推理与导航
MoEs 比你想象的更强大:基于 RoE 的超并行推理扩展
ARE:扩展Agent环境与评估
DiffusionNFT:基于前向过程的在线扩散强化
TempSamp-R1:面向视频LLM的强化微调有效时间采样
OnePiece:将上下文工程与推理引入工业级级联排序系统
OmniInsert:通过扩散Transformer模型实现无掩码的任意参考视频插入