Command Palette
Search for a command to run...
Papers
Täglich aktualisierte hochmoderne KI-Forschungsarbeiten, um Sie über die neuesten KI-Trends auf dem Laufenden zu halten
Papers

BEAR: Benchmarking und Verbesserung multimodaler Sprachmodelle für atomare verkörperte Fähigkeiten

Diffusions-Transformers mit Repräsentations-Autoencoder






























QeRL: Über Effizienz hinaus – Quantisierungsverstärktes Verstärkungslernen für LLMs
Inversenfreie Wilson-Schleifen für Transformer: Ein praktischer Diagnoseansatz für Invarianz und Ordnungsempfindlichkeit
TUMIX: Multi-Agent Test-Time Scaling mit Werkzeugnutzungsmischung
R-Horizont: Wie weit kann Ihr großes Schlussfolgerungsmodell wirklich in Breite und Tiefe gehen?
AutoPR: Lassen Sie Ihre akademische Beförderung automatisieren!
Multimodale Prompt-Optimierung: Warum mehrere Modalitäten nicht für MLLMs genutzt werden sollten
TAG: Tangential Amplifying Guidance für hallucinationsresistente Diffusions-Sampling
Mit der Kamera denken: Ein vereinheitlichtes multimodales Modell für kamerazentriertes Verständnis und Generierung
D2E: Skalierung der vision-aktionsspezifischen Vortrainierung auf Desktop-Daten zur Übertragung auf eingebettete KI
Code2Video: Ein codezentriertes Paradigma für die Generierung von Bildungs-Videos
Dr. Bias: Soziale Ungleichheiten in künstlich-intelligenten medizinischen Empfehlungssystemen
Das Potenzial der zweiten Ordnungsoptimierung für LLMs: Eine Studie mit vollständigem Gauss-Newton
Meta-Awareness verbessert Schlussfolgerungsmodelle: Selbstausrichtungsverstärkendes Lernen
Von dem Was zum Warum: Ein Multi-Agentensystem zur evidenzbasierten Schlussfolgerung chemischer Reaktionsbedingungen
DreamOmni2: Multimodale, anweisungsbasierende Bearbeitung und Generierung
VideoCanvas: Einheitliche Video-Vervollständigung aus beliebigen räumlich-zeitlichen Patchen mittels Kontextbedingung
UniVideo: Einheitliches Verstehen, Generieren und Bearbeiten von Videos
MemMamba: Die Neubewertung von Speichermustern in State-Space-Modellen
MM-HELIX: Steigerung der multimodalen langkettigen reflektiven Schlussfolgerung durch eine ganzheitliche Plattform und adaptive hybride Politikoptimierung
PromptCoT 2.0: Skalierung der Prompt-Synthese für das Reasoning großer Sprachmodelle
Extract-0: Ein spezialisiertes Sprachmodell für die Informationsextraktion aus Dokumenten
OmniRetarget: interaktionsbewahrende Datengenerierung für humanoiden ganzkörperbasierten Lokomotions- und Szeneninteraktionskontrolle
WildSpeech-Bench: Benchmarking End-to-End SpeechLLMs in the Wild
Token-orientierte Bearbeitung interner Aktivierungen zur Ausrichtung großer Sprachmodelle
Zu lernen: tokenweise dynamische Gating-Mechanismen für ressourcenschwache visuelle Sprachmodellierung
Lernen von Agenten durch frühe Erfahrungen
MATRIX: Mask Track Alignment für interaktionsbewusste Videoerzeugung
RLinf-VLA: Ein einheitlicher und effizienter Rahmen für die VLA+RL-Trainingsweise
SHANKS: Simultane Wahrnehmung und Denken für Sprachmodelle
Lumina-DiMOO: Ein Omni-Diffusions-Großsprachmodell für die multimodale Generierung und Verständnis