Command Palette
Search for a command to run...
Papers
Täglich aktualisierte hochmoderne KI-Forschungsarbeiten, um Sie über die neuesten KI-Trends auf dem Laufenden zu halten
Papers

ViDiC: Video Difference Captioning

PretrainZero: Verstärkungsbasiertes aktives Vortrainieren






























Jeder Token zählt: Verallgemeinerung von 16M Ultra-langen Kontexten in großen Sprachmodellen
SimScale: Lernen des Fahrens durch realweltbasierte Simulation in Skalierung
Skywork-R1V4: Hin zum agentenhaften multimodalen Intelligenz durch abwechselndes Denken mit Bildern und DeepResearch
Geführte selbstentwickelnde LLMs mit minimaler menschlicher Aufsicht
MultiShotMaster: Ein steuerbarer Rahmen für die Mehrfach-Aufnahme-Videogenerierung
MG-Nav: Dual-Skalige visuelle Navigation mittels spärlicher räumlicher Memory
Der Consistency Critic: Korrektur von Inkonsistenzen in generierten Bildern mittels referenzgeleiteter aufmerksamer Ausrichtung
Wie weit sind wir von wirklich nützlichen Deep-Research-Agenten entfernt?
Stabilisierung des Verstärkungslernens mit LLMs: Formulierung und Praktiken
Envision: Benchmarking unifieder Verständnis- und Generierungsfähigkeiten für kausale Weltprozess-Einsichten
LongVT: Anreizschaffung für „Langzeit-Videos Denken“ durch native Tool-Aufrufe
Von Code-Grundmodellen zu Agents und Anwendungen: Ein praktischer Leitfaden zur Code-Intelligenz
Physikgetriebene räumlich-zeitliche Modellierung für die Erkennung von künstlich generierten Videos
Mem-α: Lernen der Speichererstellung mittels Verstärkungslernen
Suche im Selbstspielen: Erweitern der Fähigkeiten von Agenten ohne Überwachung
CudaForge: Ein Agentenframework mit Hardware-Rückkopplung für die CUDA-Kernel-Optimierung
ScaleNet: Skalierung vortrainierter neuronaler Netzwerke durch inkrementelle Parameter
Optimierung der Mischung aus Block-Attention
FractalForensics: Proaktive Deepfake-Erkennung und -Ortung mittels fraktaler Wasserzeichen
Ketten-Gedanken-Hijacking
InstanceAssemble: layoutorientierte Bildgenerierung über instanzbasiertes Zusammensetzen mit Aufmerksamkeit
3EED: Alles überall im dreidimensionalen Raum verankern
DetectiumFire: Ein umfassender multimodaler Datensatz, der Vision und Sprache verbindet, um das Verständnis von Feuer zu fördern
CHIP: Ein multisensor-Datensatz zur 6D-Pose-Schätzung von Stühlen in industriellen Umgebungen
Geometrisch eingeschränktes Agens für räumliches Schließen
DeepSeek-V3.2: Der Fortschritt bei offenen großen Sprachmodellen
DiP: Diffusionsmodelle im Pixelraum beherrschen
Architektur-Entkopplung ist nicht alles, was Sie für ein einheitliches multimodales Modell benötigen
Vision Bridge Transformer im großen Maßstab
AnyTalker: Skalierung der generativen Erstellung von Videoinhalten mit mehreren Personen unter Einbeziehung der Interaktivitätsverbesserung