Command Palette
Search for a command to run...
Papers
최신 AI 트렌드를 파악할 수 있도록 매일 업데이트되는 최첨단 AI 연구 논문
개의 논문

Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding

균형 잡힌 사고를 통한 효율적 추론






























행동 전 확인: 비전-언어-행동 모델을 위한 비전 기반 표현 강화
보완적 강화 학습
정렬은 언어 모델을 기술적이지 않고 규범적으로 만듭니다.
MosaicMem: 제어 가능한 비디오 월드 모델을 위한 하이브리드 공간 기억
MetaClaw: Just Talk -- 야생 환경에서 메타학습 및 진화를 수행하는 Agent
Video-CoE: Chain of Events를 통한 비디오 이벤트 예측 강화
FunCineForge: 다양한 영화 장면에서의 Zero-Shot 영화 더빙을 위한 통합 데이터셋 툴킷 및 모델
Large Language Models를 위한 In-Context Watermarks
WorldCam: 카메라 포즈를 통합 기하학적 표현으로 활용한 대화형 자기회귀 3D 게임 월드
비디오 추론의 신비 해명
Kinema4D: 시공간적 구체적 시뮬레이션을 위한 운동학적 4D 세계 모델링
Qianfan-OCR: 문서 지능을 위한 통합 엔드투엔드 모델
InCoder-32B: 산업 시나리오용 코드 기반 모델
MiroThinker-1.7 및 H1: 검증을 통한 고강도 연구 Agent 의 방향성
HSImul3R: 시뮬레이션 준비가 완료된 인간 - 장면 상호작용을 위한 물리 기반 루프 재구성
깊이 혼합 어텐션 (Mixture-of-Depths Attention)
Attention 잔차
실제 대도시를 기반으로 한 월드 시뮬레이션 모델의 Grounding
OpenSeeker: 훈련 데이터를 완전히 오픈소스화하여 최전선 검색 에이전트의 민주화를 실현하다
AI Can Learn Scientific Taste
MM-CondChain: 시각적으로 기반을 둔 심층 구성적 추론을 위한 프로그래밍적으로 검증된 벤치마크
비전 - 언어 모델이 쉘 게임을 해결할 수 있는가?
OmniForcing: 실시간 오디오-비주얼 동시 생성의 잠재력 해방
daVinci-Env: 대규모 오픈 소프웨어 엔지니어링 환경 합성
Cheers: 패치 세부 사항과 의미 표현을 분리하여 통합된 멀티모달 이해 및 생성 가능하게 함
LMEB: Long-horizon Memory Embedding Benchmark
DreamVideo-Omni: 잠재적 정체성 강화 학습을 통한 오미-모션 제어 다중 대상 비디오 커스터마이징
ShotVerse: 텍스트 기반 다중 샷 비디오 생성을 위한 영화적 카메라 제어 기술의 발전
컴퓨터 사용 Agent 를 위한 비디오 기반 Reward Modeling
IndexCache: 교차 계층 인덱스 재사용을 통한 희소 어텐션 가속화