Command Palette
Search for a command to run...
Papers
Täglich aktualisierte hochmoderne KI-Forschungsarbeiten, um Sie über die neuesten KI-Trends auf dem Laufenden zu halten

LongVT: Anreizschaffung für „Langzeit-Videos Denken“ durch native Tool-Aufrufe

Von Code-Grundmodellen zu Agents und Anwendungen: Ein praktischer Leitfaden zur Code-Intelligenz































LongVT: Anreizschaffung für „Langzeit-Videos Denken“ durch native Tool-Aufrufe

Von Code-Grundmodellen zu Agents und Anwendungen: Ein praktischer Leitfaden zur Code-Intelligenz






























Physikgetriebene räumlich-zeitliche Modellierung für die Erkennung von künstlich generierten Videos
Mem-α: Lernen der Speichererstellung mittels Verstärkungslernen
Suche im Selbstspielen: Erweitern der Fähigkeiten von Agenten ohne Überwachung
CudaForge: Ein Agentenframework mit Hardware-Rückkopplung für die CUDA-Kernel-Optimierung
ScaleNet: Skalierung vortrainierter neuronaler Netzwerke durch inkrementelle Parameter
Optimierung der Mischung aus Block-Attention
FractalForensics: Proaktive Deepfake-Erkennung und -Ortung mittels fraktaler Wasserzeichen
Ketten-Gedanken-Hijacking
InstanceAssemble: layoutorientierte Bildgenerierung über instanzbasiertes Zusammensetzen mit Aufmerksamkeit
3EED: Alles überall im dreidimensionalen Raum verankern
DetectiumFire: Ein umfassender multimodaler Datensatz, der Vision und Sprache verbindet, um das Verständnis von Feuer zu fördern
CHIP: Ein multisensor-Datensatz zur 6D-Pose-Schätzung von Stühlen in industriellen Umgebungen
Geometrisch eingeschränktes Agens für räumliches Schließen
DeepSeek-V3.2: Der Fortschritt bei offenen großen Sprachmodellen
DiP: Diffusionsmodelle im Pixelraum beherrschen
Architektur-Entkopplung ist nicht alles, was Sie für ein einheitliches multimodales Modell benötigen
Vision Bridge Transformer im großen Maßstab
AnyTalker: Skalierung der generativen Erstellung von Videoinhalten mit mehreren Personen unter Einbeziehung der Interaktivitätsverbesserung
REASONEDIT: Hin zu modellbasierten Bildbearbeitungssystemen mit verbessertem Schlussfolgern
OpenApps: Simulation von Umgebungsvariationen zur Messung der Zuverlässigkeit von UI-Agenten
Qwen3-VL Technischer Bericht
G2VLM: Geometry Grounded Vision Language Model mit einheitlicher 3D-Rekonstruktion und räumlicher Reasoning
Multi-Crit: Benchmarking multimodaler Urteiler hinsichtlich der Beachtung pluralistischer Kriterien
MIRA: Multimodales iteratives Reasoning-Agent für Bildbearbeitung
ENACT: Evaluierung körperhafter Kognition mit Weltmodellierung egozentrischer Interaktion
Canvas-to-Image: Kompositionelle Bildgenerierung mit multimodalen Steuerungen
Video Generationsmodelle sind gute latente Belohnungsmodelle
DeepSeekMath-V2: Hin zu selbstverifizierendem mathematischem Schlussfolgern
ToolOrchestra: Steigerung der Intelligenz durch effiziente Modell- und Werkzeugorchestrierung
Denken Sie visuell, Schlussfolgern Sie textuell: Visuelle-Sprachliche Synergie in ARC
Physikgetriebene räumlich-zeitliche Modellierung für die Erkennung von künstlich generierten Videos
Mem-α: Lernen der Speichererstellung mittels Verstärkungslernen
Suche im Selbstspielen: Erweitern der Fähigkeiten von Agenten ohne Überwachung
CudaForge: Ein Agentenframework mit Hardware-Rückkopplung für die CUDA-Kernel-Optimierung
ScaleNet: Skalierung vortrainierter neuronaler Netzwerke durch inkrementelle Parameter
Optimierung der Mischung aus Block-Attention
FractalForensics: Proaktive Deepfake-Erkennung und -Ortung mittels fraktaler Wasserzeichen
Ketten-Gedanken-Hijacking
InstanceAssemble: layoutorientierte Bildgenerierung über instanzbasiertes Zusammensetzen mit Aufmerksamkeit
3EED: Alles überall im dreidimensionalen Raum verankern
DetectiumFire: Ein umfassender multimodaler Datensatz, der Vision und Sprache verbindet, um das Verständnis von Feuer zu fördern
CHIP: Ein multisensor-Datensatz zur 6D-Pose-Schätzung von Stühlen in industriellen Umgebungen
Geometrisch eingeschränktes Agens für räumliches Schließen
DeepSeek-V3.2: Der Fortschritt bei offenen großen Sprachmodellen
DiP: Diffusionsmodelle im Pixelraum beherrschen
Architektur-Entkopplung ist nicht alles, was Sie für ein einheitliches multimodales Modell benötigen
Vision Bridge Transformer im großen Maßstab
AnyTalker: Skalierung der generativen Erstellung von Videoinhalten mit mehreren Personen unter Einbeziehung der Interaktivitätsverbesserung
REASONEDIT: Hin zu modellbasierten Bildbearbeitungssystemen mit verbessertem Schlussfolgern
OpenApps: Simulation von Umgebungsvariationen zur Messung der Zuverlässigkeit von UI-Agenten
Qwen3-VL Technischer Bericht
G2VLM: Geometry Grounded Vision Language Model mit einheitlicher 3D-Rekonstruktion und räumlicher Reasoning
Multi-Crit: Benchmarking multimodaler Urteiler hinsichtlich der Beachtung pluralistischer Kriterien
MIRA: Multimodales iteratives Reasoning-Agent für Bildbearbeitung
ENACT: Evaluierung körperhafter Kognition mit Weltmodellierung egozentrischer Interaktion
Canvas-to-Image: Kompositionelle Bildgenerierung mit multimodalen Steuerungen
Video Generationsmodelle sind gute latente Belohnungsmodelle
DeepSeekMath-V2: Hin zu selbstverifizierendem mathematischem Schlussfolgern
ToolOrchestra: Steigerung der Intelligenz durch effiziente Modell- und Werkzeugorchestrierung
Denken Sie visuell, Schlussfolgern Sie textuell: Visuelle-Sprachliche Synergie in ARC