Command Palette
Search for a command to run...
Papers
Täglich aktualisierte hochmoderne KI-Forschungsarbeiten, um Sie über die neuesten KI-Trends auf dem Laufenden zu halten

LLM-as-a-Tutor: Policy-bewusste Prompt-Anpassung für nicht-verifizierbares RL

Atomic Task Graph: Ein einheitliches Framework für agentische Planung und Ausführung































LLM-as-a-Tutor: Policy-bewusste Prompt-Anpassung für nicht-verifizierbares RL

Atomic Task Graph: Ein einheitliches Framework für agentische Planung und Ausführung






























LongE2V: Langzeithorizont-Ereignisbasierte Videorekonstruktion, -vorhersage und -bildinterpolation mit Videodiffusionsmodellen
UniClawBench: Ein universeller Benchmark für proaktive Agenten bei realen Aufgaben
Ideen haben Genome: Benchmarking wissenschaftlicher Abstammungslogik und abstammungsbasierter Ideengenerierung
Warum kann ich meine Schublade nicht öffnen? Vermeidung objektgetriebener Abkürzungen in der Zero-Shot Compositional Action Recognition
Video-Oasis: Evaluierung des Videoverständnisses neu denken
Vidu S1: Ein Echtzeit-Interaktives Videogenerierungsmodell
Messung der Kluft zwischen menschlichen und LLM-generierten Forschungsideen
Der Harness-Effekt: Wie Orchestrierungsdesign die Token-Ökonomie unternehmerischer agentischer KI bestimmt
Unendliche Welten mit vielseitigen Interaktionen
Skalierung von Mixture-of-Experts-Videovortraining für verkörperte Intelligenz
LAME M-VLA: DUALES LATENTES GEDÄCHTNIS IN VISION-LANGUAGE-ACTION-MODELLEN FÜR ROBOTISCHE MANIPULATION
Akkurate, interdisziplinäre und transparente Struktur-Eigenschafts-Verständnis durch tiefes natives strukturelles Reasoning
Parallelisierte autoregressive Dekodierung für omnimodale dichte Videountertitelung
Light-Omni: Reflex statt logisches Denken im agentenbasierten Videoverständnis mit Langzeitgedächtnis
Vision als vereinheitlichte multimodale Generierung
Hierarchische sparse Attention richtig gemacht: Auf dem Weg zur Modellierung unendlicher Kontexte
AlayaWorld: Generierung von Langzeithorizontund spielbaren Videowelten
RynnWorld-4D: 4D-verkörperte Weltmodelle für robotische Manipulation
Nemotron-Labs-3-Puzzle-75B-A9B: Komprimierung hybrider MoE-LLMs
Multi-Turn On-Policy Destillation mit Präfix-Wiederholung
Gemma 4 Technischer Bericht
UI-MOPD: Multi-Plattform On-Policy Destillation für kontinuierliches Lernen von GUI-Agenten
Wan-Streamer v0.2: Höhere Auflösung, gleiche Latenz
EVA-Client: Ein einheitliches Framework für Deployment, Evaluation und Datenerfassung auf realen Robotern
GigaWorld-1: Ein Fahrplan zur Entwicklung von Weltmodellen für die Bewertung von Roboterrichtlinien
ResearchStudio-Idea: Eine evidenzbasierte Forschungsideen-Fähigkeitssuite aus ML-Konferenzergebnissen
ResearchStudio-Reel: Automatisierung der letzten Meile der Forschung vom Paper zu Poster, Video und Blog
FINAL Bench: Messung funktionalen metakognitiven Schließens in großen Sprachmodellen
SceneFun3D: Fein granulare Funktionalitätsund Affordanzverständnis in 3D-Szenen
TheoremGraph: Überbrückung formaler und informeller Mathematik
LongE2V: Langzeithorizont-Ereignisbasierte Videorekonstruktion, -vorhersage und -bildinterpolation mit Videodiffusionsmodellen
UniClawBench: Ein universeller Benchmark für proaktive Agenten bei realen Aufgaben
Ideen haben Genome: Benchmarking wissenschaftlicher Abstammungslogik und abstammungsbasierter Ideengenerierung
Warum kann ich meine Schublade nicht öffnen? Vermeidung objektgetriebener Abkürzungen in der Zero-Shot Compositional Action Recognition
Video-Oasis: Evaluierung des Videoverständnisses neu denken
Vidu S1: Ein Echtzeit-Interaktives Videogenerierungsmodell
Messung der Kluft zwischen menschlichen und LLM-generierten Forschungsideen
Der Harness-Effekt: Wie Orchestrierungsdesign die Token-Ökonomie unternehmerischer agentischer KI bestimmt
Unendliche Welten mit vielseitigen Interaktionen
Skalierung von Mixture-of-Experts-Videovortraining für verkörperte Intelligenz
LAME M-VLA: DUALES LATENTES GEDÄCHTNIS IN VISION-LANGUAGE-ACTION-MODELLEN FÜR ROBOTISCHE MANIPULATION
Akkurate, interdisziplinäre und transparente Struktur-Eigenschafts-Verständnis durch tiefes natives strukturelles Reasoning
Parallelisierte autoregressive Dekodierung für omnimodale dichte Videountertitelung
Light-Omni: Reflex statt logisches Denken im agentenbasierten Videoverständnis mit Langzeitgedächtnis
Vision als vereinheitlichte multimodale Generierung
Hierarchische sparse Attention richtig gemacht: Auf dem Weg zur Modellierung unendlicher Kontexte
AlayaWorld: Generierung von Langzeithorizontund spielbaren Videowelten
RynnWorld-4D: 4D-verkörperte Weltmodelle für robotische Manipulation
Nemotron-Labs-3-Puzzle-75B-A9B: Komprimierung hybrider MoE-LLMs
Multi-Turn On-Policy Destillation mit Präfix-Wiederholung
Gemma 4 Technischer Bericht
UI-MOPD: Multi-Plattform On-Policy Destillation für kontinuierliches Lernen von GUI-Agenten
Wan-Streamer v0.2: Höhere Auflösung, gleiche Latenz
EVA-Client: Ein einheitliches Framework für Deployment, Evaluation und Datenerfassung auf realen Robotern
GigaWorld-1: Ein Fahrplan zur Entwicklung von Weltmodellen für die Bewertung von Roboterrichtlinien
ResearchStudio-Idea: Eine evidenzbasierte Forschungsideen-Fähigkeitssuite aus ML-Konferenzergebnissen
ResearchStudio-Reel: Automatisierung der letzten Meile der Forschung vom Paper zu Poster, Video und Blog
FINAL Bench: Messung funktionalen metakognitiven Schließens in großen Sprachmodellen
SceneFun3D: Fein granulare Funktionalitätsund Affordanzverständnis in 3D-Szenen
TheoremGraph: Überbrückung formaler und informeller Mathematik