Command Palette
Search for a command to run...
Papers
최신 AI 트렌드를 파악할 수 있도록 매일 업데이트되는 최첨단 AI 연구 논문
개의 논문

EnergAIzer: AI 워크로드를 위한 빠르고 정확한 GPU 전력 추정 프레임워크

이미지 수정에서 검증자 기반 강화 학습 활용하기






























RoundPipe를 사용한 다수의 소비자용 GPU에서의 효율적인 훈련
ExoActor: 일반화 가능한 인터랙티브 휴머노이드 제어를 위한 외향적 비디오 생성
공진화 정책 압축
신시대의 시각적 생성: 원자적 매핑에서 에이전트 세계 모델링으로의 진화
이질적인 과학 기반 모델 협력
Diffusion Templates: 제어 가능한 diffusion을 위한 통합된 플러그인 프레임워크
RADIO-ViPE: 동적 환경에서 오픈 어휘 Semantic SLAM을 위한 온라인 조밀 다중 모달 융합
ClawGym: 효과 Claw 에이전트를 구축하기 위한 확장 가능한 프레임워크
TIDE 전환: 확산 대형 언어 모델을 위한 아키텍처 간 디스틸레이션
은차 압축을 통한 대규모 언어 모델의 탐색 연구
GLM-5V-Turbo: 다중모dal Agents를 위한 네이티브 기반 모델로의 접근
SWE-chat: 실제 환경에서의 실사용자가 작성한 코딩 에이전트 상호작용
AdaExplore: 효율적인 커널 생성을 위한 실패 기반 적응 및 다양성 보존 탐색
재생성을 통한 정제: 수정 공간 확대는 통합 멀티모달 모델의 이미지 정제 능력을 향상시킵니다
AutoResearchBench: 복잡한 과학 문헌 발견에 대한 AI agents의 벤치마킹
Meta-CoT: 이미지 편집에서 세분성과 일반화 향상
DV-World: Real-World Scenarios에서의 데이터 시각화 에이전트 벤치마킹
데이터 기반 프로그래밍: 원시 코퍼스부터 자기 개선형 LLM을 위한 테스트 주도 데이터 엔지니어링
재귀적 다중 에이전트 시스템
스킬 검색 증강을 위한 에이전틱 AI
SketchVLM: 비전-언어 모델은 생각을 설명하고 사용자를 안내하기 위해 이미지를 주석 처리할 수 있습니다.
RSRCC: Retrieval-Augmented Best-of-N Ranking을 통해 구축된 원격 감지 지역 변화 이해 벤치마크
LongSpeech: 장기 오디오의 필기, 번역 및 이해를 위한 확장 가능한 벤치마크
ClawMark: 다중 턴, 다중 일일, 다중 모달 coworker agents를 위한 라이브 월드 벤치마크
Tuna-2: Pixel Embeddings가 Multimodal 이해 및 생성을 위해 Vision Encoders를 능가하다
비전-라이트-액션 안전: 위협, 과제, 평가 및 메커니즘
ReVSI: VLM 3D 추론에 대한 정확한 평가를 위한 시각적 공간 지능 평가 재구축
스킬에서 인재로: 현실의 기업으로서 이질적인 에이전트들을 조직하기
World-R1: 텍스트-비디오 생성을 위한 3D 제약 조건 강화
Semantic Progress Function을 통한 비디오 분석 및 생성