Command Palette
Search for a command to run...
Papers
최신 AI 트렌드를 파악할 수 있도록 매일 업데이트되는 최첨단 AI 연구 논문
개의 논문

Step-Audio-R1 기술 보고서

V-ReasonBench: 비디오 생성 모델을 위한 통합 추론 벤치마크 세트로의 도전






























올모 3
GPT-5를 활용한 초기 과학 가속 실험
향상된 객관적 및 체계적 평가를 위한 의료 영상 인공지능의 편향
좋은 AI 연구 에이전트가 되기 위해 필요한 요소는 무엇인가? 아이디어 다각화의 역할을 탐구한다
지시에 기반한 LLM을 활용한 흉부 X선 이미지의 병변 세그멘테이션 및 자동 생성된 대규모 데이터셋 적용
VisPlay: 이미지에서 자가진화하는 시각-언어 모델
비디오를 통한 추론: 미로 해결 과제를 통한 비디오 모델의 추론 능력에 대한 최초 평가
VIDEOP2R: 인지에서 추론에 이르는 비디오 이해
Kandinsky 5.0: 이미지 및 비디오 생성을 위한 기초 모델 가족
JAM-2: 고도로 계산 기반의 약물 유사 항체의 설계 및 높은 성공률
PathMind: 대규모 언어 모델을 활용한 지식 그래프 추론을 위한 Retrieve-Prioritize-Reason 프레임워크
검토자: 텍스트적 반성을 넘어서, 장문의 비디오 이해에서 다중모달 내면적 사고로 전환하기
MVI-Bench: LVLMs의 오도적 시각 입력에 대한 강건성 평가를 위한 종합 벤치마크
세계 시뮬레이터는 추론할 수 있는가? Gen-ViRe: 생성형 시각적 추론 벤치마크
스타일 하나가 코드 하나보다 더 가치 있다: 이산 스타일 공간을 통한 코드에서 스타일 이미지 생성 해제
AraLingBench: 대규모 언어 모델의 아랍어 언어 능력을 평가하기 위한 인간 주석 기반 벤치마크
Think-at-Hard: 추론 기능 향상을 위한 선택적 잠재 반복 기법
HumanSense: 다중모달 인지에서 출발하여 추론을 통한 공감적이고 맥락 인지형 응답으로
CamCloneMaster: 영상 생성을 위한 기준 기반 카메라 제어 가능하게 하기
EditScore: 이미지 편집을 위한 온라인 강화학습을 고정밀 보상 모델링을 통해 열기
InteractMove: 3차원 장면에서 이동 가능한 물체를 활용한 텍스트 제어형 인간-물체 상호작용 생성
웹코치: 세션 간 기억 안내를 통한 자가진화형 웹 에이전트
신뢰하기를 배우기: 순차적 의사결정에서 제안자 신뢰성의 변화에 대한 베이지안 적응
GroupRank: 강화학습에 의해 구동되는 그룹 기반 재정렬 프레임워크
MMaDA-Parallel: 사고 인식 편집 및 생성을 위한 다중모달 대규모 확산 언어 모델
TiViBench: 영상 생성 모델을 위한 Think-in-Video 추론 평가
Part-X-MLLM: 부분 인지형 3D 다중모달 대규모 언어 모델
Uni-MoE-2.0-Omni: 고급 MoE, 훈련 및 데이터를 활용한 언어 중심 옴니모달 대규모 모델의 확장
P1: 강화학습을 통한 물리올림피아드 정복
랜슬로트: 완전 동형 암호화 내에서 효율적이고 프라이버시를 보장하는 바지안-저항성 분산 학습을 위한 방향