Command Palette
Search for a command to run...
Papers
최신 AI 트렌드를 파악할 수 있도록 매일 업데이트되는 최첨단 AI 연구 논문
개의 논문

FDABench: 이질적 데이터에 대한 분석 쿼리에 대한 데이터 에이전트를 위한 벤치마크

그림 그리는 것보다 생각하는 것이 더 어렵다: 텍스트-이미지 모델은 무대를 준비할 수는 있지만, 연출은 할 수 없는가?






























UniVerse-1: 전문가 통합을 통한 통합 음성-영상 생성
기초 모델은 단계별 몸체 인식 추론에서 얼마나 우수한가?
스파이킹브레인 기술 보고서: 스파이킹 브레인 기반 대규모 모델
SAGE: 의미 이해를 위한 현실적인 벤치마크
WAVECLIP: 웨이블릿 토큰화를 통한 적응형 해상도 CLIP
임베딩젬마: 강력하고 가벼운 텍스트 표현
GRPO를 활용한 음성 인식 언어 모델에서의 음성 이해 향상
VLMs는 시각적 공간 지능에서 얼마나 멀어졌는가? 벤치마크 기반의 관점
SIM-CoT: 감독 하에 의도된 사고의 사슬
SWE-QA: 언어 모델은 리포지토리 수준의 코드 질문에 답할 수 있는가?
비디오 모델은 제로샷 학습자이자 추론자이다.
기계공학 분석 문제의 핵심적 해결을 위한 N-플러스-1 GPT 에이전시
메모리-QA: 다중모달 메모리를 기반으로 한 회상 질문 답변
MAPO: 혼합 우위 정책 최적화
하이퍼베이글: 다중모달 이해 및 생성을 위한 통합 가속 프레임워크
사전 훈련 데이터에서의 강화 학습
시각운동 정책에서 본체지각 상태가 필요한가요?
베이서: 아랍어 문서에서 마크다운으로의 비전-언어 모델 OCR
GenExam: 다중학문적 텍스트-이미지 시험
Nav-R1: 몸체 장면 내의 추론과 탐색
MoEs는 당신이 생각하는 것보다 강하다: RoE를 통한 초병렬 추론 스케일링
ARE: 에이전트 환경과 평가의 규모 확대
DiffusionNFT: 온라인 확산 강화 및 전방 과정
TempSamp-R1: 비디오 LLMs를 위한 강화 학습 미세조정을 통한 효과적인 시계열 샘플링
원피스: 산업용 커스케이드 랭킹 시스템에 맥락 공학과 추론을 도입하다
OmniInsert: 참조 영상의 자유로운 마스크 없는 동영상 삽입을 위한 확산 트랜스포머 모델
LIMI: 에이전시를 위한 적은 것이 더 크다
단백질 서열 내 다중 금속 결합 부위를 효율적으로 예측하기 위한 모듈형 융합 신경망 접근법
IndexTTS2: 감정 표현이 풍부하고 지속시간을 제어할 수 있는 자기회귀형 제로샷 텍스트투스피치의 획기적 도약
세부적인 인간 선호와 완전한 확산 경로를 직접 정렬하기