Command Palette
Search for a command to run...
论文
每日更新的前沿人工智能研究论文,帮助您紧跟最新的人工智能趋势

无需训练的文本引导多模态扩散Transformer颜色编辑

基于用户画像感知的LLM-as-a-Judge的播客推荐评估































无需训练的文本引导多模态扩散Transformer颜色编辑

基于用户画像感知的LLM-as-a-Judge的播客推荐评估






























MultiRef:基于多个视觉参考的可控图像生成
提示编排标记语言
LongSplat:适用于随意长视频的鲁棒非对齐3D高斯点阵
多智能体链:通过多智能体蒸馏与智能体强化学习构建端到端智能体基础模型
HPSv3:面向全谱人类偏好评分
ComputerRL:面向计算机使用Agent的端到端在线强化学习扩展
说话人去标识系统中的身份泄露评估
下一视觉粒度生成
4DNeX:轻松实现前馈式4D生成建模
ComoRAG:一种面向有状态长篇叙述推理的认知启发式记忆组织RAG
用于宽带计算与通信的集成微波神经网络
GTool:基于大语言模型的图增强工具规划
基于机器学习增强的恒电位框架对锂金属-电解质界面枝晶形成的观测
XQuant:通过KV缓存重计算突破LLM推理的内存墙
BeyondWeb:在万亿规模预训练中规模化合成数据的启示
PaperRegister:通过分层注册索引提升细粒度论文检索
DINOv3
SSRL:自搜索强化学习
Thyme:超越图像的思考
用文化知识对多语言多模态LLM进行接地
HiFiTTS-2:一个大规模高带宽语音数据集
CryptoScope:利用大语言模型实现密码逻辑漏洞的自动化检测
医学图谱RAG:通过图谱检索增强生成实现安全的医学大语言模型
Puppeteer:为你的3D模型绑定并动画化
STream3R:基于因果Transformer的可扩展序列3D重建
PRELUDE:一个旨在要求对长上下文进行全局理解与推理的基准
ToonComposer:通过生成式后关键帧技术简化动画制作
NextStep-1:面向大规模连续Token的自回归图像生成
We-Math 2.0:一种用于激励视觉数学推理的多功能MathBook系统
COREVQA:一种众包观察与推理蕴含的视觉问答基准
MultiRef:基于多个视觉参考的可控图像生成
提示编排标记语言
LongSplat:适用于随意长视频的鲁棒非对齐3D高斯点阵
多智能体链:通过多智能体蒸馏与智能体强化学习构建端到端智能体基础模型
HPSv3:面向全谱人类偏好评分
ComputerRL:面向计算机使用Agent的端到端在线强化学习扩展
说话人去标识系统中的身份泄露评估
下一视觉粒度生成
4DNeX:轻松实现前馈式4D生成建模
ComoRAG:一种面向有状态长篇叙述推理的认知启发式记忆组织RAG
用于宽带计算与通信的集成微波神经网络
GTool:基于大语言模型的图增强工具规划
基于机器学习增强的恒电位框架对锂金属-电解质界面枝晶形成的观测
XQuant:通过KV缓存重计算突破LLM推理的内存墙
BeyondWeb:在万亿规模预训练中规模化合成数据的启示
PaperRegister:通过分层注册索引提升细粒度论文检索
DINOv3
SSRL:自搜索强化学习
Thyme:超越图像的思考
用文化知识对多语言多模态LLM进行接地
HiFiTTS-2:一个大规模高带宽语音数据集
CryptoScope:利用大语言模型实现密码逻辑漏洞的自动化检测
医学图谱RAG:通过图谱检索增强生成实现安全的医学大语言模型
Puppeteer:为你的3D模型绑定并动画化
STream3R:基于因果Transformer的可扩展序列3D重建
PRELUDE:一个旨在要求对长上下文进行全局理解与推理的基准
ToonComposer:通过生成式后关键帧技术简化动画制作
NextStep-1:面向大规模连续Token的自回归图像生成
We-Math 2.0:一种用于激励视觉数学推理的多功能MathBook系统
COREVQA:一种众包观察与推理蕴含的视觉问答基准