Command Palette
Search for a command to run...
Papers
최신 AI 트렌드를 파악할 수 있도록 매일 업데이트되는 최첨단 AI 연구 논문
개의 논문

오미나지아: 네이티브 옴니모달 AI 에이전트를 향해

MobilityBench: 실제 이동 환경에서의 경로 계획 Agent 평가를 위한 벤치마크






























맹점에서 성과로: 대규모 다중모달 모델을 위한 진단 기반 반복 훈련
일관성의 삼위일체: 일반 세계 모델을 정의하는 원칙
GUI-Libra: 동작 인지 감독과 부분 검증 가능한 RL을 통한 네이티브 GUI 에이전트의 추론 및 행동 훈련
SkyReels-V4: 다중 모달 영상-오디오 생성, 인페인팅 및 편집 모델
ARLArena: 안정적인 에이전트 강화 학습을 위한 통합 프레임워크
DreamID-Omni: 제어 가능한 인간 중심의 오디오-비디오 생성을 위한 통합 프레임워크
MolHIT: 계층적 이산 확산 모델을 통한 분자 그래프 생성의 진보
HyTRec: 긴 행동 시퀀스 추천을 위한 하이브리드 시계열 인지 어텐션 아키텍처
DREAM: Agentic Metrics를 활용한 깊이 있는 연구 평가
LongCLI-Bench: 명령줄 인터페이스에서 장기 지평(agentic) 프로그래밍을 위한 초기 벤치마크 및 연구
PyVision-RL: 강화학습을 통한 오픈형 에이전트 비전 모델 구축
지각에서 행동으로: 시각적 추론을 위한 상호작용 기준 평가
쿼리 중심형 및 메모리 인지형 리랭커: 긴 컨텍스트 처리를 위한 접근
LLM 터미널 기능 확장 위한 데이터 엔지니어링
DSDR: LLM 추론에서 탐색을 위한 이중 스케일 다각도 정규화
Mobile-O: 모바일 디바이스에서의 통합 다중모달 이해 및 생성
TOPReward: 로보틱스를 위한 숨겨진 제로샷 보상으로서 토큰 확률
ManCAR: 순차 추천을 위한 맨폴드 제약 잠재 추론 및 적응형 테스트 시 계산
VLANeXt: 강력한 VLA 모델을 구축하기 위한 조리법
매우 큰 비디오 추론 세트
시각 정보 증가를 통한 대규모 비전 언어 모델의 선택적 훈련
DeepVision-103K: 다중모달 추론을 위한 시각적으로 다양하고 포괄적인 범위를 갖추며 검증 가능한 수학 데이터셋
SARAH: 공간 인식 실시간 에이전트 인간
EgoPush: 모바일 로봇을 위한 엔도세트릭 다중 객체 재배치를 위한 엔드투엔드 학습
생성된 현실: 손과 카메라 제어를 활용한 상호작용 영상 생성을 통한 인간 중심의 세계 시뮬레이션
VESPO: 안정적인 오프폴리시 LLM 훈련을 위한 변분 시퀀스 수준 소프트 정책 최적화
아르시 트리니티 대규모 기술 보고서
실제 적용을 위한 선도적 AI 위험 관리 프레임워크: 위험 분석 기술 보고서 v1.5
유니파이드 레이턴트(UL): 레이턴트를 어떻게 훈련할 것인가
모바일 에이전트-v3.5: 다중 플랫폼 기초 GUI 에이전트