Command Palette
Search for a command to run...
Papers
Täglich aktualisierte hochmoderne KI-Forschungsarbeiten, um Sie über die neuesten KI-Trends auf dem Laufenden zu halten
Papers

Von der Skalierung zur Geschwindigkeit: Adaptive Test-Time-Skalierung für die Bildbearbeitung

Multi-Agent-Kooperation durch In-Context Co-Player Inference






























ACTIONENGINE: Von reaktiven zu programmatischen GUI Agents mittels State Machine Memory
CiteAudit: Sie haben es zitiert, aber haben Sie es gelesen? Ein Benchmark zur Überprüfung wissenschaftlicher Referenzen im LLM-Zeitalter
Modus-Suchend trifft auf Mittelwert-Suchend für schnelle Langvideoerzeugung
CUDA Agent: Großskalige agentebasierte RL für leistungsstarke CUDA-Kernel-Generierung
Recovered in Translation: Effiziente Pipeline für die automatisierte Übersetzung von Benchmarks und Datensätzen
Verbesserung des räumlichen Verständnisses in der Bildgenerierung mittels Belohnungsmodellierung
dLLM: Einfache Diffusions-Sprachmodellierung
Exploratorische, gedächtnisverstärkte LLM-Agenten durch hybride On- und Off-Policy-Optimierung
Die Vorstellungskraft unterstützt die visuelle Schlussfolgerung, doch noch nicht im latente Raum
OmniGAIA: Hin zu natively omni-modalen KI-Agenten
MobilityBench: Ein Benchmark zur Bewertung von Route-Planning-Agenten in realen Mobilitätsszenarien
Von Blindstellen zu Gewinnen: diagnostikgetriebenes iteratives Training für große multimodale Modelle
Die Dreifaltigkeit der Konsistenz als definierendes Prinzip für allgemeine Weltmodelle
GUI-Libra: Training Native GUI Agents to Reason and Act with Action-aware Supervision and Partially Verifiable RL
SkyReels-V4: Mehrmodales Video-Audio-Generierungs-, Inpainting- und Bearbeitungsmodell
ARLArena: Ein einheitlicher Rahmen für stabiles agenzienbasiertes Verstärkungslernen
DreamID-Omni: Einheitlicher Rahmen für steuerbare, menschenzentrierte Audio-Video-Generierung
MolHIT: Fortschritte bei der Molekülgraphen-Generierung mit hierarchischen diskreten Diffusionsmodellen
HyTRec: Eine hybride zeitbewusste Aufmerksamkeitsarchitektur für die langfristige sequenzielle Empfehlung
DREAM: Deep Research Evaluation mit agentenbasierten Metriken
LongCLI-Bench: Ein vorläufiger Benchmark und Studie zur langfristigen agentenbasierten Programmierung in Kommandozeilenschnittstellen
PyVision-RL: Entwicklung offener agenter Sichtmodelle durch Verstärkungslernen
Von der Wahrnehmung zur Aktion: Ein interaktiver Benchmark für visuelle Reasoning
Abfrageorientierter und speicherbewusster Reranker für die Verarbeitung langer Kontexte
Zur Datenengineering für die Skalierung der Terminal-Fähigkeiten von LLM
DSDR: Dual-Scale Diversity Regularization für die Exploration im LLM-Reasoning
Mobile-O: Einheitliche multimodale Wahrnehmung und Generierung auf mobilen Geräten
TOPReward: Token-Wahrscheinlichkeiten als versteckte Zero-Shot-Belohnungen für die Robotik
ManCAR: Mannigfaltigkeitsbeschränkte latente Reasoning mit adaptiver Testzeit-Computierung für sequenzielle Empfehlungen
VLANeXt: Rezepte zum Aufbau robuster VLA-Modelle