Command Palette
Search for a command to run...
Papers
Täglich aktualisierte hochmoderne KI-Forschungsarbeiten, um Sie über die neuesten KI-Trends auf dem Laufenden zu halten

PaperRegister: Steigerung der flexiblen, feinkörnigen Papier Suche durch hierarchische Registerindizierung

DINOv3































PaperRegister: Steigerung der flexiblen, feinkörnigen Papier Suche durch hierarchische Registerindizierung

DINOv3






























SSRL: Selbstsuchende Verstärkungslernverfahren
Thymian: Denken Sie über Bilder hinaus
Grundlegung mehrsprachiger multimodaler LLMs mit kulturellem Wissen
HiFiTTS-2: Ein großflächiges Sprachdatensatz mit hoher Bandbreite
CryptoScope: Die Nutzung großer Sprachmodelle zur automatisierten Erkennung kryptographischer Logikschwächen
Medizinisches Graphen-RAG: Ein Schritt hin zu sicheren medizinischen Großsprachmodellen durch graphbasierte abfrageverstärkte Generierung
Puppeteer: Ihre 3D-Modelle riggen und animieren
STream3R: Skalierbare sequentielle 3D-Rekonstruktion mit kausalem Transformer
VORBEREITUNG: Ein Benchmark, der globales Verständnis und Schlussfolgerung über lange Kontexte erfordert
ToonComposer: Vereinfachung der Zeichentrickproduktion durch generatives Post-Keyframing
NextStep-1: Der Weg zur autoregressiven Bildgenerierung mit kontinuierlichen Token in Skalierung
We-Math 2.0: Ein vielseitiges MathBook-System zur Anreizschaffung für visuelles mathematisches Denken
COREVQA: Ein Benchmark für visuelle Fragebeantwortung mit Beobachtung und Schlussfolgerung durch die Masse
RelayFormer: Ein einheitlicher lokaler-globaler Aufmerksamkeitsrahmen für skalierbare Lokalisierung von Bild- und Videobearbeitungen
GMF-Drive: Gated Mamba Fusion mit räumlich-awareer BEV-Darstellung für End-to-End-Autonomes Fahren
Sehen, Hören, Erinnern und Schlussfolgern: Ein multimodales Agens mit Langzeitgedächtnis
Diffusions-LLMs können schneller als AR-Inferenz über diskrete Diffusion erzwingen
AWorld: Dynamisches Multi-Agenten-System mit stabiler Manövrierfähigkeit für robuste Lösung des GAIA-Problems
Story2Board: Ein trainingsfreier Ansatz zur expressiven Erstellung von Storyboards
Ersatzidentität: Eine leichtgewichtige und plug-and-play-Identitätssteuerung für die Videogenerierung
Mol-R1: Hin zu expliziter Lang-CoT-Reasoning in der Molekülentdeckung
Llama-Nemotron: Effiziente Modellen für logisches Schlussfolgern
Document Haystack: Ein Benchmark für multimodale Bild-/Dokumentenverstehens-Vision-LLMs mit langen Kontexten
Echo-4o: Die Kraft synthetischer Bilder basierend auf GPT-4o zur Verbesserung der Bildgenerierung nutzen
Virtuelle Färbung von markierungsfreiem Gewebe in der Bildgebungsmassenspektrometrie
VisCodex: Einheitliche multimodale Codegenerierung durch die Integration von Visueller und Codierungsmodelle
HierSearch: Ein hierarchisches tiefes Suchframework für Unternehmen, das lokale und Web-Suchen integriert
Zeit ist eine Eigenschaft: Ausnutzung zeitlicher Dynamik in Diffusions-Sprachmodellen
CharacterShot: Steuerbare und konsistente 4D-Charakteranimation
Jenseits von zehn Zugriffen: Freigabe langfristiger agenter Suche mit großskaliger asynchroner RL
SSRL: Selbstsuchende Verstärkungslernverfahren
Thymian: Denken Sie über Bilder hinaus
Grundlegung mehrsprachiger multimodaler LLMs mit kulturellem Wissen
HiFiTTS-2: Ein großflächiges Sprachdatensatz mit hoher Bandbreite
CryptoScope: Die Nutzung großer Sprachmodelle zur automatisierten Erkennung kryptographischer Logikschwächen
Medizinisches Graphen-RAG: Ein Schritt hin zu sicheren medizinischen Großsprachmodellen durch graphbasierte abfrageverstärkte Generierung
Puppeteer: Ihre 3D-Modelle riggen und animieren
STream3R: Skalierbare sequentielle 3D-Rekonstruktion mit kausalem Transformer
VORBEREITUNG: Ein Benchmark, der globales Verständnis und Schlussfolgerung über lange Kontexte erfordert
ToonComposer: Vereinfachung der Zeichentrickproduktion durch generatives Post-Keyframing
NextStep-1: Der Weg zur autoregressiven Bildgenerierung mit kontinuierlichen Token in Skalierung
We-Math 2.0: Ein vielseitiges MathBook-System zur Anreizschaffung für visuelles mathematisches Denken
COREVQA: Ein Benchmark für visuelle Fragebeantwortung mit Beobachtung und Schlussfolgerung durch die Masse
RelayFormer: Ein einheitlicher lokaler-globaler Aufmerksamkeitsrahmen für skalierbare Lokalisierung von Bild- und Videobearbeitungen
GMF-Drive: Gated Mamba Fusion mit räumlich-awareer BEV-Darstellung für End-to-End-Autonomes Fahren
Sehen, Hören, Erinnern und Schlussfolgern: Ein multimodales Agens mit Langzeitgedächtnis
Diffusions-LLMs können schneller als AR-Inferenz über diskrete Diffusion erzwingen
AWorld: Dynamisches Multi-Agenten-System mit stabiler Manövrierfähigkeit für robuste Lösung des GAIA-Problems
Story2Board: Ein trainingsfreier Ansatz zur expressiven Erstellung von Storyboards
Ersatzidentität: Eine leichtgewichtige und plug-and-play-Identitätssteuerung für die Videogenerierung
Mol-R1: Hin zu expliziter Lang-CoT-Reasoning in der Molekülentdeckung
Llama-Nemotron: Effiziente Modellen für logisches Schlussfolgern
Document Haystack: Ein Benchmark für multimodale Bild-/Dokumentenverstehens-Vision-LLMs mit langen Kontexten
Echo-4o: Die Kraft synthetischer Bilder basierend auf GPT-4o zur Verbesserung der Bildgenerierung nutzen
Virtuelle Färbung von markierungsfreiem Gewebe in der Bildgebungsmassenspektrometrie
VisCodex: Einheitliche multimodale Codegenerierung durch die Integration von Visueller und Codierungsmodelle
HierSearch: Ein hierarchisches tiefes Suchframework für Unternehmen, das lokale und Web-Suchen integriert
Zeit ist eine Eigenschaft: Ausnutzung zeitlicher Dynamik in Diffusions-Sprachmodellen
CharacterShot: Steuerbare und konsistente 4D-Charakteranimation
Jenseits von zehn Zugriffen: Freigabe langfristiger agenter Suche mit großskaliger asynchroner RL