Command Palette
Search for a command to run...
Papers
Täglich aktualisierte hochmoderne KI-Forschungsarbeiten, um Sie über die neuesten KI-Trends auf dem Laufenden zu halten
Papers

InsertAnywhere: Brückenbildung zwischen 4D-Szenengeometrie und Diffusionsmodellen für realistische Videoobjekt-Einfügung

Mindscape-orientierte abgerufene erweiterte Generierung zur Verbesserung des Verständnisses langer Kontexte






























Messung der Kurzform-Faktualität in großen Sprachmodellen
DeepSearchQA: Brücke der Umfassendheit für tiefe Forschungsagenten
MEM1: Das Lernen zur Synergie von Gedächtnis und Schlussfolgerung für effiziente Langzeit-Agenten
AI-Trader: Benchmarking autonome Agenten in Echtzeit-Finanzmärkten
Latente implizite visuelle Inferenz
LLM-Personas als Ersatz für Feldexperimente bei der Methodenbewertung
DataFlow: Ein LLM-getriebener Rahmen für die einheitliche Datenbereitstellung und Workflows-Automatisierung im Zeitalter der datenzentrierten KI
HiStream: Effiziente Erzeugung hochauflösender Videos durch redundanzeliminiertes Streaming
TokSuite: Die Messung des Einflusses der Tokenisierungsstrategie auf das Verhalten von Sprachmodellen
Nemotron 3 Nano: Open, effizienter Mixture-of-Experts-Hybrid-Mamba-Transformer-Modell für agenzentisches Reasoning
Jenseits der Speicherung: Ein multimodales ordinal-regressives Benchmark zur Aufdeckung von Popularitätsbias in Vision-Language-Modellen
DreaMontage: Frame-gesteuerte One-Shot-Videoerzeugung mit beliebigen Rahmen
T2AV-Compass: Hin zu einer einheitlichen Bewertung für Text-zu-Audio-Video-Generierung
TongSIM: Eine allgemeine Plattform zur Simulation intelligenter Maschinen
Qwen-Image-Layered: Ein Weg zur inhärenten Editierbarkeit durch Schichtdekomposition
RoboSafe: Sicherung körperhafter Agenten durch ausführbare Sicherheitslogik
Evaluierung der Sicherheit von Arzneimitteln durch große Sprachmodelle in der praktischen Anwendung im primären Gesundheitswesen der NHS
Mehrfach-LLM-Thematische Analyse mit dualen Zuverlässigkeitsmetriken: Kombination von Cohens Kappa und semantischer Ähnlichkeit zur Validierung qualitativer Forschung
Aktive Intelligenz in Videogavataren durch geschlossenen Schleifen-Weltmodellierung
FaithLens: Erkennung und Erklärung von Treue-Halluzinationen
SAM Audio: Segmentieren von Allem im Audio
Schritt-DeepResearch Technischer Bericht
SpatialTree: Wie räumliche Fähigkeiten in MLLMs verzweigen
SemanticGen: Videoerzeugung im semantischen Raum
Automatisierte stereotaktische Radiosurgery-Planung unter Verwendung eines menschlich-im-Loop-Reasoning-Modells mit großer Sprachagenten
LongVideoAgent: Multi-Agent-Reasoning mit langen Videos
GenEnv: Schwierigkeitsausgeglichene ko-evolutionäre Entwicklung von LLM-Agenten und Umgebungssimulatoren
WorldWarp: Propagieren von 3D-Geometrie mit asynchroner Video-Diffusion
LoGoPlanner: Lokalisierungsgestützte Navigationspolitik mit metrikbewusster visueller Geometrie
Können LLMs das Schwierigkeitsniveau von Lernenden abschätzen? Mensch-AI-Übereinstimmung der Schwierigkeit durch Profizienz-Simulation zur Vorhersage der Item-Schwierigkeit