Command Palette
Search for a command to run...
Papers
최신 AI 트렌드를 파악할 수 있도록 매일 업데이트되는 최첨단 AI 연구 논문
개의 논문

TEMPO: 대규모 추론 모델을 위한 Test-time Training의 확장

AnyRecon: Video Diffusion Model을 이용한 임의 시점 3D Reconstruction






























AgentSPEX: An Agent SPecification and EXecution Language
CoInteract: 공간적으로 구조화된 공동 생성(Co-Generation)을 통한 물리적 일관성을 갖춘 인간-객체 상호작용 비디오 합성
Tstars-Tryon 1.0: 다양한 패션 아이템을 위한 강건하고 사실적인 가상 Try-On
Large Language Model Inference를 위한 Fast NF4 Dequantization Kernels
EasyVideoR1: 비디오 이해를 위한 더욱 용이한 RL
MultiWorld: 확장 가능한 Multi-Agent Multi-View 비디오 월드 모델 (Scalable Multi-Agent Multi-View Video World Models)
OpenGame: 게임을 위한 Open Agentic Coding
Agent-World: 진화하는 범용 agent 지능을 위한 실세계 환경 합성의 스케일링
OneVL: 시각-언어 설명을 통한 단일 단계 잠재 추론 및 계획 (One-Step Latent Reasoning and Planning with Vision-Language Explanation)
변별적 텍스트 표현(Discriminative Text Representation)을 통한 클래스 레이블 기반의 원스텝 이미지 생성을 텍스트로 확장하기
ScribblePrompt: 모든 생의학 이미지를 위한 빠르고 유연한 상호작용형 Segmentation
Long-VITA: 선도적인 Short-Context 정확도를 유지하며 Large Multi-modal Models를 1 Million Tokens로 확장하기
UI-TARS: Native Agent를 통한 자동화된 GUI 상호작용의 선구적 접근
HunyuanVideo: Large Video Generative Models를 위한 체계적 프레임워크
MathNet: 수학적 추론 및 검색을 위한 글로벌 멀티모달 벤치마크
LLM Agent에서의 Externalization: Memory, Skills, Protocols 및 Harness Engineering에 관한 통합적 리뷰
Active Context Compression: LLM Agent에서의 자율적 메모리 관리
손실을 최소화하라! 효율적인 병렬 추론을 위한 조기 경로 Pruning 학습법
Qwen3.5-Omni 기술 보고서
효율적이고 비용 효율적인 Retrieval-Augmented Generation 시스템을 위한 Web Retrieval-Aware Chunking (W-RAC)
PersonaVLM: 장기적 개인화 멀티모달 LLMs
데이터나 최적화 없이 구현하는 최대 뇌 손상: Sign-Bit Flips를 통한 Neural Networks의 교란
Diffusion Probabilistic Models의 SNR-t Bias 규명
멀티모달 OCR: 문서 내 모든 요소의 파싱(Parse Anything from Documents)
Granite-speech: 강력한 영어 ASR 능력을 갖춘 오픈 소스 speech-aware LLMs
Fish-Speech: Advanced Multilingual Text-to-Speech Synthesis를 위한 Large Language Model 활용 연구
비디오 객체 및 상호작용 삭제 (Video Object and Interaction Deletion)
VoxCPM: 문맥 인식 음성 생성 및 실감 나는 음성 클로닝을 위한 Tokenizer-Free TTS
OmniVoice: Diffusion Language Models를 이용한 다국어 Zero-Shot Text-to-Speech 연구
시각이 텍스트가 되는 지점: Vision-Language Models에서 OCR Routing Bottleneck의 위치 파악