Command Palette
Search for a command to run...
Papers
Täglich aktualisierte hochmoderne KI-Forschungsarbeiten, um Sie über die neuesten KI-Trends auf dem Laufenden zu halten

Exploratorische, gedächtnisverstärkte LLM-Agenten durch hybride On- und Off-Policy-Optimierung

Die Vorstellungskraft unterstützt die visuelle Schlussfolgerung, doch noch nicht im latente Raum































Exploratorische, gedächtnisverstärkte LLM-Agenten durch hybride On- und Off-Policy-Optimierung

Die Vorstellungskraft unterstützt die visuelle Schlussfolgerung, doch noch nicht im latente Raum






























OmniGAIA: Hin zu natively omni-modalen KI-Agenten
MobilityBench: Ein Benchmark zur Bewertung von Route-Planning-Agenten in realen Mobilitätsszenarien
Von Blindstellen zu Gewinnen: diagnostikgetriebenes iteratives Training für große multimodale Modelle
Die Dreifaltigkeit der Konsistenz als definierendes Prinzip für allgemeine Weltmodelle
GUI-Libra: Training Native GUI Agents to Reason and Act with Action-aware Supervision and Partially Verifiable RL
SkyReels-V4: Mehrmodales Video-Audio-Generierungs-, Inpainting- und Bearbeitungsmodell
ARLArena: Ein einheitlicher Rahmen für stabiles agenzienbasiertes Verstärkungslernen
DreamID-Omni: Einheitlicher Rahmen für steuerbare, menschenzentrierte Audio-Video-Generierung
MolHIT: Fortschritte bei der Molekülgraphen-Generierung mit hierarchischen diskreten Diffusionsmodellen
HyTRec: Eine hybride zeitbewusste Aufmerksamkeitsarchitektur für die langfristige sequenzielle Empfehlung
DREAM: Deep Research Evaluation mit agentenbasierten Metriken
LongCLI-Bench: Ein vorläufiger Benchmark und Studie zur langfristigen agentenbasierten Programmierung in Kommandozeilenschnittstellen
PyVision-RL: Entwicklung offener agenter Sichtmodelle durch Verstärkungslernen
Von der Wahrnehmung zur Aktion: Ein interaktiver Benchmark für visuelle Reasoning
Abfrageorientierter und speicherbewusster Reranker für die Verarbeitung langer Kontexte
Zur Datenengineering für die Skalierung der Terminal-Fähigkeiten von LLM
DSDR: Dual-Scale Diversity Regularization für die Exploration im LLM-Reasoning
Mobile-O: Einheitliche multimodale Wahrnehmung und Generierung auf mobilen Geräten
TOPReward: Token-Wahrscheinlichkeiten als versteckte Zero-Shot-Belohnungen für die Robotik
ManCAR: Mannigfaltigkeitsbeschränkte latente Reasoning mit adaptiver Testzeit-Computierung für sequenzielle Empfehlungen
VLANeXt: Rezepte zum Aufbau robuster VLA-Modelle
Ein sehr großes Video-Reasoning-Testfeld
Selektives Training großer visueller Sprachmodelle mittels visueller Informationsgewinn
DeepVision-103K: Ein visuell vielfältiges, umfassend abgedecktes und überprüfbares mathematisches Datensatz für multimodales Schlussfolgern
SARAH: Raumbezogene Echtzeit-Agentenmenschen
EgoPush: Lernen von Ende-zu-Ende-egozentrischer Mehrobjekt-Umstellung für mobile Roboter
Generierte Realität: menschenzentrierte Weltsimulation mithilfe interaktiver Videoerzeugung mit Hand- und Kamerasteuerung
VESPO: Variational Sequence-Level Soft Policy Optimization für stabile Off-Policy LLM-Training
Arcee Trinity Large Technical Report
Frontier AI Risk Management Framework in Practice: Ein technischer Risikoanalysebericht v1.5
OmniGAIA: Hin zu natively omni-modalen KI-Agenten
MobilityBench: Ein Benchmark zur Bewertung von Route-Planning-Agenten in realen Mobilitätsszenarien
Von Blindstellen zu Gewinnen: diagnostikgetriebenes iteratives Training für große multimodale Modelle
Die Dreifaltigkeit der Konsistenz als definierendes Prinzip für allgemeine Weltmodelle
GUI-Libra: Training Native GUI Agents to Reason and Act with Action-aware Supervision and Partially Verifiable RL
SkyReels-V4: Mehrmodales Video-Audio-Generierungs-, Inpainting- und Bearbeitungsmodell
ARLArena: Ein einheitlicher Rahmen für stabiles agenzienbasiertes Verstärkungslernen
DreamID-Omni: Einheitlicher Rahmen für steuerbare, menschenzentrierte Audio-Video-Generierung
MolHIT: Fortschritte bei der Molekülgraphen-Generierung mit hierarchischen diskreten Diffusionsmodellen
HyTRec: Eine hybride zeitbewusste Aufmerksamkeitsarchitektur für die langfristige sequenzielle Empfehlung
DREAM: Deep Research Evaluation mit agentenbasierten Metriken
LongCLI-Bench: Ein vorläufiger Benchmark und Studie zur langfristigen agentenbasierten Programmierung in Kommandozeilenschnittstellen
PyVision-RL: Entwicklung offener agenter Sichtmodelle durch Verstärkungslernen
Von der Wahrnehmung zur Aktion: Ein interaktiver Benchmark für visuelle Reasoning
Abfrageorientierter und speicherbewusster Reranker für die Verarbeitung langer Kontexte
Zur Datenengineering für die Skalierung der Terminal-Fähigkeiten von LLM
DSDR: Dual-Scale Diversity Regularization für die Exploration im LLM-Reasoning
Mobile-O: Einheitliche multimodale Wahrnehmung und Generierung auf mobilen Geräten
TOPReward: Token-Wahrscheinlichkeiten als versteckte Zero-Shot-Belohnungen für die Robotik
ManCAR: Mannigfaltigkeitsbeschränkte latente Reasoning mit adaptiver Testzeit-Computierung für sequenzielle Empfehlungen
VLANeXt: Rezepte zum Aufbau robuster VLA-Modelle
Ein sehr großes Video-Reasoning-Testfeld
Selektives Training großer visueller Sprachmodelle mittels visueller Informationsgewinn
DeepVision-103K: Ein visuell vielfältiges, umfassend abgedecktes und überprüfbares mathematisches Datensatz für multimodales Schlussfolgern
SARAH: Raumbezogene Echtzeit-Agentenmenschen
EgoPush: Lernen von Ende-zu-Ende-egozentrischer Mehrobjekt-Umstellung für mobile Roboter
Generierte Realität: menschenzentrierte Weltsimulation mithilfe interaktiver Videoerzeugung mit Hand- und Kamerasteuerung
VESPO: Variational Sequence-Level Soft Policy Optimization für stabile Off-Policy LLM-Training
Arcee Trinity Large Technical Report
Frontier AI Risk Management Framework in Practice: Ein technischer Risikoanalysebericht v1.5