Command Palette
Search for a command to run...
Papers
최신 AI 트렌드를 파악할 수 있도록 매일 업데이트되는 최첨단 AI 연구 논문
개의 논문

OCR인가 아닌가? 실세계 대규모 데이터셋을 통한 MLLM 시대의 문서 정보 추출(Document Information Extraction)에 대한 재고

dnaHNet: 유전체 서열 학습을 위한 확장 가능하고 계층적인 Foundation Model






























뉴럴 컴퓨터 (Neural Computers)
ASGuard: Targeted Jailbreaking Attack을 완화하기 위한 Activation-Scaling Guard
GlobalSplat: Global Scene Tokens를 통한 효율적인 Feed-Forward 3D Gaussian Splatting
추론 모델을 어떻게 Fine-Tune 할 것인가? Student-Consistent SFT Data를 합성하기 위한 Teacher-Student 협력 프레임워크
RAD-2: Generator-Discriminator 프레임워크에서의 Reinforcement Learning 확장 (Scaling)
DR3-Eval: 현실적이고 재현 가능한 Deep Research Evaluation을 향하여
HY-World 2.0: 3D World의 재구성(Reconstructing), 생성(Generating) 및 시뮬레이션(Simulating)을 위한 멀티모달(Multi-Modal) World Model
pi0.7: 창발적 역량을 갖춘 조종 가능한 범용 로봇 파운데이션 모델 (Steerable Generalist Robotic Foundation Model)
GTR: Guided Thought Reinforcement Prevents Thought Collapse in RL-based VLM Agent Training
Large Language Models를 위한 Agent Skills: Architecture, Acquisition, Security, 그리고 향후 과제
공간 이론: 파운데이션 모델은 능동적 탐색을 통해 공간적 신념을 구축할 수 있는가?
메모리 전이 학습: Coding Agent에서 메모리가 도메인 간에 어떻게 전이되는가
OccuBench: Language World Models를 통한 실세계 전문 작업에서의 AI Agents 평가
SpatialEvo: 결정론적 기하학적 환경을 통한 자기 진화형 공간 지능 (Self-Evolving Spatial Intelligence)
RationalRewards: Reasoning Rewards가 Training 및 Test Time 모두에서 Visual Generation의 Scale을 확장하다
Seedance 2.0: 세계의 복잡성을 위한 비디오 생성 기술의 발전
GameWorld: 멀티모달 Game Agent의 표준화 및 검증 가능한 평가를 향하여
ScaleFormer와 PanScale 벤치마크를 통한 교차 스케일 Pansharpening
ParseBench: AI Agent를 위한 문서 파싱 벤치마크
메모리 인텔리전스 Agent
PROPELLA-1: 대규모 LLM 데이터 큐레이션을 위한 다중 속성 문서 어노테이션
Long-Context Visual Document Understanding을 위한 Internalized Reasoning
TurboQuant: 근사 최적 왜곡률을 갖는 온라인 Vector Quantization
BERT-as-a-Judge: 효율적인 Reference-based LLM 평가를 위한 Lexical Methods의 강건한 대안
SPPO: Long-Horizon Reasoning Tasks를 위한 Sequence-Level PPO
화면 위의 튜링 테스트: Mobile GUI Agent의 인간다움(Humanization)을 평가하기 위한 Benchmark
Audio-Omni: 멀티모달 이해를 다재다능한 오디오 Generation 및 Editing으로 확장하기
대규모 언어 모델(LLMs)의 On-Policy Distillation에 대한 재고: 현상학, 메커니즘 및 레시피
KnowRL: Minimal-Sufficient Knowledge Guidance를 이용한 Reinforcement Learning 기반 LLM Reasoning 능력 향상
Uni-ViGU: A Diffusion-Based Video Generator를 통한 통합된 Video Generation 및 Understanding을 향하여