Command Palette
Search for a command to run...
Papers
Täglich aktualisierte hochmoderne KI-Forschungsarbeiten, um Sie über die neuesten KI-Trends auf dem Laufenden zu halten
Papers

IF-Bench: Benchmarking und Verbesserung von MLLMs für Infrarotbilder mit generativer Visualisierung

RecGPT-V2 Technischer Bericht






























Vector Prism: Animieren von Vektorgrafiken durch Schichten der semantischen Struktur
OpenDataArena: Ein faire und offener Wettbewerbsspielplatz zur Bewertung des Wertes von Post-Training-Datensätzen
Video Reality Test: Können KI-generierte ASMR-Videos VLMs und Menschen täuschen?
WorldPlay: Hin zum langfristigen geometrischen Konsistenz für Echtzeit-Interaktives Weltmodellieren
MMGR: Multimodale generative Reasoning
Frontier Science: Beurteilung der Fähigkeit von KI, wissenschaftliche Aufgaben auf Expertenebene zu erfüllen
Der FACTS Leaderboard: Ein umfassender Benchmark für die Faktengenauigkeit von Large Language Models
Nemotron-Cascade: Skalierung kaskadierter Verstärkungslernverfahren für allgemeinzweckorientierte Reasoning-Modelle
KlingAvatar 2.0 Technischer Bericht
QwenLong-L1.5: Nachtrainingsrezept für langfristige Schlussfolgerung und Gedächtnisverwaltung
ReFusion: Ein Diffusions-LLM mit paralleler autoregressiver Dekodierung
Error-Free Linear Attention ist ein kostenloses Mittagessen: Exakte Lösung aus kontinuierlichen Zeitdynamiken
Gedächtnis im Zeitalter von AI-Agenten
LongVie 2: Multimodales steuerbares Ultra-Langes-Video-Weltmodell
FirstAidQA: Ein synthetischer Datensatz für Erste Hilfe und Notfallreaktionen in Umgebungen mit geringer Netzwerkverbindung
CUDA-L2: Überbieten der cuBLAS-Leistung für Matrixmultiplikation durch Verstärkungslernen
X-VLA: Soft-Prompt-basierter Transformer als skalierbarer cross-Embodiment Vision-Language-Action-Modell
Nemotron 3 Nano: Offenes, effizientes Mixture-of-Experts-Hybrid-Modell aus Mamba-Transformer für agenzienbasiertes Schlussfolgern
Structure From Tracking: Struktur erhaltende Bewegungsdistanzierung für die Videogenerierung
Untersuchung des Informationstransfers zwischen MLLM und Diffusion mit MetaCanvas
PersonaLive! Ausdrucksstarke Animation von Porträtfotos für Live-Streaming
V-RGBX: Video-Editierung mit präzisen Steuerungsoptionen für intrinsische Eigenschaften
SVG-T2I: Skalierung des Text-zu-Bild-Latent-Diffusionsmodells ohne Variationalen Autoencoder
DentalGPT: Anreizschaffung für multimodales komplexes Schlussfolgern in der Zahnmedizin
SSRB: Direkte Abfrage natürlicher Sprache für große heterogene semi-strukturierte Daten
MUVR: Ein Multi-Modales Benchmark für ungeschnittene Video-Abfrage mit Multi-Level-Visueller Korrespondenz
Bewertung von Gemini-Roboterpolitiken in einem Veo-Welten-Simulator
MotionEdit: Benchmarking und Lernen von bewegungsorientierter Bildbearbeitung
Erreichen eines Olympia-Niveau-Geometrie-LLM-Agenten durch Komplexitätsverstärkendes Verstärkungslernen
OPV: outcomebasiertes Prozessverifizierungsverfahren für eine effiziente lange Ketten-des-Denkens-Verifizierung