Command Palette
Search for a command to run...
Papers
Täglich aktualisierte hochmoderne KI-Forschungsarbeiten, um Sie über die neuesten KI-Trends auf dem Laufenden zu halten

HERMES++: Auf dem Weg zu einem einheitlichen Fahrweltmodell für das Verständnis und die Generierung 3D-Szenen

OpenSearch-VL: Ein offenes Rezept für multimodale Such-Agents der neuesten Generation































HERMES++: Auf dem Weg zu einem einheitlichen Fahrweltmodell für das Verständnis und die Generierung 3D-Szenen

OpenSearch-VL: Ein offenes Rezept für multimodale Such-Agents der neuesten Generation






























Technischer Bericht RLDX-1
Stream-T1: Test-Time-Scaling für das Streamen der Video-Generierung
Stream-R1: Zuverlässigkeits-Perplexität-bewusste Belohnungs-Distillation für Streaming-Video-Generierung
Uni-OPD: Vereinheitlichung von On-Policy Distillation mit einer Dual-Perspective-Rezept
AGENTIC-IMODELS: Entwicklung agenterbasierter Interpretierbarkeitstools durch autoresearch
HEAVYSKILL: Schweres Denken als interne Fähigkeit in agenticen Systemen
WindowsWorld: Ein prozessorientierter Benchmark für autonome GUI-Agenten in professionellen, anwendungübergreifenden Umgebungen
Halluzinationen untergraben das Vertrauen; Metakognition ist ein Weg nach vorn
X2SAM: Segmentierung in Bildern und Videos
OpenSeeker-v2: Die Grenzen von Search Agents durch informative und hochkomplexe Trajektorien erweitern
PRISM: Pre-Alignment durch Black-Box On-Policy Distillation für Multimodales Reinforcement Learning
ARIS: Autonomes Forschen durch adversarielle Multi-Agent-Kollaboration
ProgramBench: Können Sprachmodelle Programme von Grund auf neu erstellen?
Effiziente beschleunigte Berechnung der Graphen-Edit-Distanz auf GPU
Unsicherheitsabschätzung basierend auf großen Sprachmodellen für die Bewertung von Lageindikatoren in sozialen Medien zur Krisenberichterstattung
Canonical LST: Eine protokollnahe Liquid-Staking-Lösung für Tezos
Trennung von Intelligenz und Ausführung: Eine Workflow-Engine für das Model Context Protocol
Das Verständnis der Leistungsplateaus in der Text-zu-Video-Abfrage: Eine umfassende empirische und linguistische Analyse
Persistent Visual Memory: Aufrechterhaltung der Wahrnehmung für die tiefe Generierung in LVLMs
EnergAIzer: Schnelles und präzises GPU-Leistungsabschätzungs-Framework für KI-Arbeitslasten
Nutzung von verifiziererbasierter Verstärkungslernen im Bildbearbeitungskontext
Effizientes Training auf mehreren Consumer-GPUs mit RoundPipe
ExoActor: Exozentrische Video-Generierung als generalisierbare interaktive Kontrolle humanoider Roboter
Co-Evolving Policy Distillation
Visuelle Generierung im neuen Zeitalter: Eine Entwicklung von atomarer Abbildung zu agentenbasiertem Weltmodellieren
Kooperation heterogener wissenschaftlicher Fundamentalmuster
Diffusionsvorlagen: Ein einheitliches Plugin-Rahmenwerk für kontrollierte Diffusion
RADIO-ViPE: Online-Tight-Kopplung der Multi-Modale-Fusion für open-vocabulary semantische SLAM in dynamischen Umgebungen
ClawGym: Ein skalierbares Framework zur Entwicklung effektiver Claw-Agenten
Die TIDE-Wende: Architekturübergreifende Distillation für Diffusions-LLMs
Technischer Bericht RLDX-1
Stream-T1: Test-Time-Scaling für das Streamen der Video-Generierung
Stream-R1: Zuverlässigkeits-Perplexität-bewusste Belohnungs-Distillation für Streaming-Video-Generierung
Uni-OPD: Vereinheitlichung von On-Policy Distillation mit einer Dual-Perspective-Rezept
AGENTIC-IMODELS: Entwicklung agenterbasierter Interpretierbarkeitstools durch autoresearch
HEAVYSKILL: Schweres Denken als interne Fähigkeit in agenticen Systemen
WindowsWorld: Ein prozessorientierter Benchmark für autonome GUI-Agenten in professionellen, anwendungübergreifenden Umgebungen
Halluzinationen untergraben das Vertrauen; Metakognition ist ein Weg nach vorn
X2SAM: Segmentierung in Bildern und Videos
OpenSeeker-v2: Die Grenzen von Search Agents durch informative und hochkomplexe Trajektorien erweitern
PRISM: Pre-Alignment durch Black-Box On-Policy Distillation für Multimodales Reinforcement Learning
ARIS: Autonomes Forschen durch adversarielle Multi-Agent-Kollaboration
ProgramBench: Können Sprachmodelle Programme von Grund auf neu erstellen?
Effiziente beschleunigte Berechnung der Graphen-Edit-Distanz auf GPU
Unsicherheitsabschätzung basierend auf großen Sprachmodellen für die Bewertung von Lageindikatoren in sozialen Medien zur Krisenberichterstattung
Canonical LST: Eine protokollnahe Liquid-Staking-Lösung für Tezos
Trennung von Intelligenz und Ausführung: Eine Workflow-Engine für das Model Context Protocol
Das Verständnis der Leistungsplateaus in der Text-zu-Video-Abfrage: Eine umfassende empirische und linguistische Analyse
Persistent Visual Memory: Aufrechterhaltung der Wahrnehmung für die tiefe Generierung in LVLMs
EnergAIzer: Schnelles und präzises GPU-Leistungsabschätzungs-Framework für KI-Arbeitslasten
Nutzung von verifiziererbasierter Verstärkungslernen im Bildbearbeitungskontext
Effizientes Training auf mehreren Consumer-GPUs mit RoundPipe
ExoActor: Exozentrische Video-Generierung als generalisierbare interaktive Kontrolle humanoider Roboter
Co-Evolving Policy Distillation
Visuelle Generierung im neuen Zeitalter: Eine Entwicklung von atomarer Abbildung zu agentenbasiertem Weltmodellieren
Kooperation heterogener wissenschaftlicher Fundamentalmuster
Diffusionsvorlagen: Ein einheitliches Plugin-Rahmenwerk für kontrollierte Diffusion
RADIO-ViPE: Online-Tight-Kopplung der Multi-Modale-Fusion für open-vocabulary semantische SLAM in dynamischen Umgebungen
ClawGym: Ein skalierbares Framework zur Entwicklung effektiver Claw-Agenten
Die TIDE-Wende: Architekturübergreifende Distillation für Diffusions-LLMs