Command Palette
Search for a command to run...
Papers
Täglich aktualisierte hochmoderne KI-Forschungsarbeiten, um Sie über die neuesten KI-Trends auf dem Laufenden zu halten
Papers

WorldGen: Von Text zu durchgehenden und interaktiven 3D-Welten

Souper-Modell: Wie einfache Arithmetik die Leistungsfähigkeit von State-of-the-Art-LLMs freisetzt






























DTS: Verbesserung großer Schlussfolgerungsmodelle durch Decoding-Tree-Skizzierung
Adaptive Kernel Design für Bayesian Optimization ist ein Leichtes mit LLMs
DePass: Einheitliche Merkmalszuweisung durch einfachen zerlegten Vorwärtsdurchlauf
COOPER: Ein einheitliches Modell für kooperative Wahrnehmung und Schlussfolgerung in räumlicher Intelligenz
Von Nachahmung zur Unterscheidung: Ein allgemeinerer Curriculum-Vorteilsmechanismus zur Verbesserung von Cross-Domain-Reasoning-Aufgaben
PaCo-RL: Fortschritt im Verstärkungslernen für konsistente Bildgenerierung mittels Paarweiser Belohnungsmodellierung
EMMA: Effiziente multimodale Verständnis, Generierung und Bearbeitung mit einer einheitlichen Architektur
EditThinker: Iteratives Denken für beliebige Bildbearbeitungsanwendungen freischalten
TwinFlow: Realisierung der One-step-Generierung auf großen Modellen mit selbstadversariellen Flüssen
CARE-PD: Ein mehrzentrisches anonymisiertes klinisches Datensatz für die Gangbeurteilung bei Parkinson-Patienten
WenetSpeech-Chuan: Ein großes Sichuan-Dialekt-Korpus mit umfassender Annotation für die Dialekt-Sprachverarbeitung
PolypSense3D: Ein Benchmark-Datensatz mit mehreren Quellen für die tiefenbewusste Messung der Polypengröße in der Endoskopie
PhysDrive: Ein multimodales Datensatz für die remote physiologische Messung zur Fahrzeuginternen Fahrerüberwachung
Künstlicher Hivemind: Die offene Homogenität von Sprachmodellen (und darüber hinaus)
OmniSVG: Ein einheitliches, skalierbares Modell zur Generierung von Vektorgrafiken
Theorie des algorithmischen Denkens
Roboter-Weltenmodell: Ein neuronales Netzwerk-Simulator für die robuste Politik-Optimierung in der Robotik
Reward Forcing: Effiziente Streaming-Videoerzeugung mittels belohnungsorientierter Verteilungsübereinstimmungs-Distillation
Semantik leitet den Weg: Harmonisierung von Semantik- und Texturmodellierung mit asynchroner latenter Diffusion
ARM-Thinker: Verstärkung multimodeller generativer Belohnungsmodelle durch agenteilen Werkzeugnutzung und visuelles Schlussfolgern
Nex-N1: Agentenmodelle, die über ein integriertes Ökosystem zur großskaligen Umweltkonstruktion trainiert wurden
DAComp: Benchmarking von Data Agents über den gesamten Data Intelligence-Lebenszyklus
Live Avatar: Echtzeit-Audio-getriebene Avatar-Generierung mit unendlicher Länge
F5-TTS: Ein Märchenerzähler, der fließende und treue Sprache mit Flow-Matching nachahmt
VOccl3D: Ein Video-Benchmark-Datensatz zur 3D-Gestalt- und Körperhaltungsschätzung bei realen Verdeckungen
Alpamayo-R1: Brückenbildung zwischen Schlussfolgern und Aktionssvorhersage für verallgemeinerungsfähiges autonomes Fahren im Long Tail
Alles ist verbunden: Eine Reise durch das Memorieren zur Testzeit, Aufmerksamkeitsbias, Behaltensleistung und Online-Optimierung
Neuüberlegung der Prompt-Design für die Inference-time-Skalierung in Text-zu-Visual-Generierung
Steuerung von Vision-Language-Action-Modellen als Anti-Exploration: Ein Ansatz zur Testzeit-Skalierung
OneThinker: All-in-one Reasoning-Modell für Bild und Video