Command Palette
Search for a command to run...
Papers
Täglich aktualisierte hochmoderne KI-Forschungsarbeiten, um Sie über die neuesten KI-Trends auf dem Laufenden zu halten

EVA: Effizientes Reinforcement Learning für End-to-End Video-Agenten

Foveated Diffusion: Effiziente räumlich adaptive Bild- und Videogenerierung































EVA: Effizientes Reinforcement Learning für End-to-End Video-Agenten

Foveated Diffusion: Effiziente räumlich adaptive Bild- und Videogenerierung






























Ego2Web: Ein Web Agent Benchmark, der auf egozentrischen Videos basiert
Von statischen Vorlagen zu dynamischen Laufzeitgraphen: Eine Übersicht zur Workflow-Optimierung für LLM Agents
SpecEyes: Beschleunigung von Agentic Multimodalen LLMs durch spekulative Wahrnehmung und Planung
DA-Flow: Degradation-Aware Optical Flow Estimation mit Diffusion Models
PEARL: Personalisiertes Modell für das Streaming-Video-Verständnis
WildWorld: Ein groß angelegter Datensatz für die dynamische Modellierung der Welt mit Aktionen und explizitem Zustand zur Generierung von ARPGs
MinerU-Diffusion: Neukonzeptualisierung von Dokument-OCR als inverse Rendering-Aufgabe mittels Diffusion Decoding
PivotRL: Agentic Post-Training mit hoher Genauigkeit bei geringem Rechenaufwand
F4Splat: Feed-Forward Predictive Densification für Feed-Forward 3D Gaussian Splatting
SpatialBoost: Verbesserung der visuellen Repräsentation durch sprachgesteuertes Reasoning
VideoDetective: Spurensuche durch extrinsische Abfragen und intrinsische Relevanz für das Verständnis langer Videos
LongCat-Flash-Prover: Vorantreiben der nativen formalen Schlussfolgerung durch agentic tool-integriertes Reinforcement Learning
Geschwindigkeit durch Einfachheit: Eine Single-Stream-Architektur für ein schnelles Audio-Video-generatives Foundation Model
Omni-WorldBench: Hin zu einer umfassenden, interaktionszentrierten Evaluierung von World Models
PrismAudio: Zerlegtes Chain-of-Thought und mehrdimensionale Belohnungen für die Video-zu-Audio-Generierung
LeWorldModel: Stabile End-to-End-Joint-Embedding-Prädiktive Architektur auf Pixelebene
FlowScene: Stil-konsistente Erzeugung von Innenraumszenen mittels multimodaler Graphen-basierter Rectified Flow
LumosX: Verknüpfung beliebiger Identitäten mit ihren Attributen für personalisierte Videogenerierung
Der Y-Kombinator für LLMs: Lösung des Long-Context-Rot-Problems mittels λ-Kalkül
ProactiveBench: Benchmarking Proactiveness in Multimodal Large Language Models
TerraScope: Pixel-verankertes visuelles Reasoning für die Erdbeobachtung
Astrolabe: Steuerung des Forward-Process Reinforcement Learning für distillierte autoregressive Videomodelle
HopChain: Multi-Hop-Datensynthese für generalisierbares visuell-linguistisches Schlussfolgern
Überbrückung semantischer und kinematischer Bedingungen mittels eines Diffusionsbasierten diskreten Motion Tokenizers
FASTER: Neuinterpretation von Echtzeit-Flow-VLAs
3DreamBooth: Ein 3D-Modell zur hochfidelitätsgesteuerten Videoerzeugung auf Basis von Subjekten
SAMA: Faktorisierung semantischer Anker und Bewegungsabstimmung für videobasierte Bearbeitung nach Instruktionen
Generative Modelle verstehen den Raum: Freisetzung impliziter 3D-Priors für das Szenenverständnis
Effizientes Reasoning mit Balanced Thinking
Vor dem Handeln schauen: Verbesserung der visuellen Grundrepräsentationen für Vision-Language-Action-Modelle
Ego2Web: Ein Web Agent Benchmark, der auf egozentrischen Videos basiert
Von statischen Vorlagen zu dynamischen Laufzeitgraphen: Eine Übersicht zur Workflow-Optimierung für LLM Agents
SpecEyes: Beschleunigung von Agentic Multimodalen LLMs durch spekulative Wahrnehmung und Planung
DA-Flow: Degradation-Aware Optical Flow Estimation mit Diffusion Models
PEARL: Personalisiertes Modell für das Streaming-Video-Verständnis
WildWorld: Ein groß angelegter Datensatz für die dynamische Modellierung der Welt mit Aktionen und explizitem Zustand zur Generierung von ARPGs
MinerU-Diffusion: Neukonzeptualisierung von Dokument-OCR als inverse Rendering-Aufgabe mittels Diffusion Decoding
PivotRL: Agentic Post-Training mit hoher Genauigkeit bei geringem Rechenaufwand
F4Splat: Feed-Forward Predictive Densification für Feed-Forward 3D Gaussian Splatting
SpatialBoost: Verbesserung der visuellen Repräsentation durch sprachgesteuertes Reasoning
VideoDetective: Spurensuche durch extrinsische Abfragen und intrinsische Relevanz für das Verständnis langer Videos
LongCat-Flash-Prover: Vorantreiben der nativen formalen Schlussfolgerung durch agentic tool-integriertes Reinforcement Learning
Geschwindigkeit durch Einfachheit: Eine Single-Stream-Architektur für ein schnelles Audio-Video-generatives Foundation Model
Omni-WorldBench: Hin zu einer umfassenden, interaktionszentrierten Evaluierung von World Models
PrismAudio: Zerlegtes Chain-of-Thought und mehrdimensionale Belohnungen für die Video-zu-Audio-Generierung
LeWorldModel: Stabile End-to-End-Joint-Embedding-Prädiktive Architektur auf Pixelebene
FlowScene: Stil-konsistente Erzeugung von Innenraumszenen mittels multimodaler Graphen-basierter Rectified Flow
LumosX: Verknüpfung beliebiger Identitäten mit ihren Attributen für personalisierte Videogenerierung
Der Y-Kombinator für LLMs: Lösung des Long-Context-Rot-Problems mittels λ-Kalkül
ProactiveBench: Benchmarking Proactiveness in Multimodal Large Language Models
TerraScope: Pixel-verankertes visuelles Reasoning für die Erdbeobachtung
Astrolabe: Steuerung des Forward-Process Reinforcement Learning für distillierte autoregressive Videomodelle
HopChain: Multi-Hop-Datensynthese für generalisierbares visuell-linguistisches Schlussfolgern
Überbrückung semantischer und kinematischer Bedingungen mittels eines Diffusionsbasierten diskreten Motion Tokenizers
FASTER: Neuinterpretation von Echtzeit-Flow-VLAs
3DreamBooth: Ein 3D-Modell zur hochfidelitätsgesteuerten Videoerzeugung auf Basis von Subjekten
SAMA: Faktorisierung semantischer Anker und Bewegungsabstimmung für videobasierte Bearbeitung nach Instruktionen
Generative Modelle verstehen den Raum: Freisetzung impliziter 3D-Priors für das Szenenverständnis
Effizientes Reasoning mit Balanced Thinking
Vor dem Handeln schauen: Verbesserung der visuellen Grundrepräsentationen für Vision-Language-Action-Modelle