Command Palette
Search for a command to run...
Papers
최신 AI 트렌드를 파악할 수 있도록 매일 업데이트되는 최첨단 AI 연구 논문
개의 논문

ARDY: 상호작용형 인간 동작 생성을 위한 하이브리드 표현 기반 자기회귀 확산 모델

PithTrain: 컴팩트하고 에이전트 네이티브한 MoE 학습 시스템






























언어 모델은 수면이 필요하다: 자기 수정 및 기억 통합 학습
HunyuanOCR-1.5: 경량 OCR VLM을 더 빠르고 더 우수하게 만들기
RGB 생성에서 밀집 필드 판독으로: 텍스트-이미지 모델을 활용한 픽셀 공간 밀집 예측
KronQ: 크로네커 분해 헤세 행렬을 이용한 LLM 양자화
신뢰 영역 정책 증류
비디오 생성 모델은 범용 비전 학습기이다
언어 지능을 위한 확장 가능한 시각적 사전 훈련
Long-Horizon-Terminal-Bench: 밀집 보상 기반 평가를 통한 장기 터미널 작업에서 에이전트의 한계 시험
LLM-as-a-Tutor: 비검증 강화학습을 위한 정책 인식형 프롬프트 적응
원자 작업 그래프: 에이전트 계획 및 실행을 위한 통합 프레임워크
LongE2V: 장기 지평선 이벤트 기반 비디오 재구성, 예측 및 프레임 보간을 위한 비디오 확산 모델
UniClawBench: 실제 환경 작업을 위한 능동형 에이전트 범용 벤치마크
아이디어에도 게놈이 있다: 과학적 계보 추론 및 계보 기반 아이디어 생성 벤치마킹
왜 내 서랍이 열리지 않을까? 제로샷 구성적 행동 인식에서 객체 기반 지름길 완화
Video-Oasis: 비디오 이해 평가의 재고
Vidu S1: 실시간 인터랙티브 비디오 생성 모델
인간과 LLM 연구 아이디어 간의 격차 측정
하네스 효과: 오케스트레이션 설계가 기업형 에이전트 AI의 토큰 경제를 결정하는 방식
다양한 상호작용이 가능한 무한 세계
체화된 지능을 위한 전문가 혼합 비디오 사전 학습의 확장
LAME M-VLA: 로봇 조작을 위한 비전-언어-행동 모델의 이중 잠재 기억
심층 원자 구조 추론을 통한 정확하고 학제적이며 투명한 구조-물성 이해
전방향 밀집 비디오 캡셔닝을 위한 병렬 자기회귀 디코딩
Light-Omni: 장기 기억을 활용한 행위자적 비디오 이해에서 추론보다 반사적 응답
통합 멀티모달 생성으로서의 비전
계층적 희소 어텐션 제대로 하기: 무한 문맥 모델링을 향하여
AlayaWorld: 장기 지평선 및 플레이 가능한 비디오 월드 생성
RynnWorld-4D: 로봇 조작을 위한 4D 체화된 세계 모델
Nemotron-Labs-3-Puzzle-75B-A9B: 하이브리드 MoE 대규모 언어 모델 압축
프리픽스 재생을 활용한 다중 턴 온폴리시 증류