Command Palette
Search for a command to run...
Papers
최신 AI 트렌드를 파악할 수 있도록 매일 업데이트되는 최첨단 AI 연구 논문
개의 논문

AWorld: 에이전트형 AI를 위한 훈련 조리법의 조율

MCP-Bench: MCP 서버를 통한 복잡한 실세계 작업을 수행하는 도구 사용 LLM 에이전트 평가를 위한 벤치마크 도구






























rStar2-Agent: 에이전트형 추론 기술 보고서
Pref-GRPO: 쌍별 선호 보상 기반 GRPO를 활용한 안정적인 텍스트-이미지 강화 학습
모바일클립2: 다중 모달 강화 학습 개선
AI-AI 미학적 협업: 명시적 상징의식과 부상하는 문법 발달을 통한 협업
시선을 심장으로: rPPG 및 건강 생체지표 추정을 위한 다중 시점 영상 데이터셋
앞으로 올 토큰의 순서를 예측하는 것은 언어 모델링을 향상시킨다
MIDAS: 실시간 자기회귀 영상 생성을 통한 다중모달 상호작용 디지털 인간 합성
이산 확산 VLA: 시각-언어-행동 정책에서 행동 해석에 이산 확산 도입하기
이론 분해를 통한 자기 보상 시각-언어 모델
전사 이상: 음성인식에서의 기계적 해석 가능성
CODA: 두뇌를 조율하는 인공지능: 분리된 강화학습을 통한 대뇌와 소뇌 기반의 이중 뇌 컴퓨터 사용 에이전트
WebSight: 강건한 웹 에이전트를 위한 비전 우선 아키텍처
UltraMemV2: 1200억 파라미터까지 확장되는 메모리 네트워크 및 우수한 장문맥 학습 성능
헤르메스 4 기술 보고서
오미니휴먼-1.5: 인지 시뮬레이션을 통한 아바타에 능동적 사고 심화
VoxHammer: 본질적인 3차원 공간에서의 훈련 없이 정밀하고 일관성 있는 3차원 편집
CMPhysBench: 응집물리에서 대규모 언어 모델 평가를 위한 벤치마크
TreePO: 히우리스틱 트리 기반 모델링을 통한 정책 최적화와 효과성, 추론 효율성 간 격차 해소
Nemotron-CC-Math: 토큰 규모 1330억 이상의 고품질 수학 전처리 데이터셋
도구 통합 추론 이해
스페이서: 공학적 과학적 영감으로 나아가며
기억을 넘어서: 반복, 기억 및 테스트 시 계산 능력 확장을 통한 추론 깊이의 확장
바이브보이스 기술 보고서
MMTok: 다중모달 커버리지 최대화를 통한 VLM의 효율적 추론
MV-RAG: 다중 시점 확산을 위한 검색 증강 기법
다중모달 기계학습을 활용한 금속 유기 프레임워크 합성과 응용 연결
적응형 운송 시스템에서의 모델 컨텍스트 프로토콜: 종합 고찰
다중 집단을 포함한 알고리즘적 집단 행동
OpenCUA: 컴퓨터 사용 에이전트를 위한 오픈 기반
공간 정책: 공간 인지 모델링 및 추론을 통한 시각운동 로봇 조작 지도