Command Palette
Search for a command to run...
Papers
Täglich aktualisierte hochmoderne KI-Forschungsarbeiten, um Sie über die neuesten KI-Trends auf dem Laufenden zu halten

EditThinker: Iteratives Denken für beliebige Bildbearbeitungsanwendungen freischalten

TwinFlow: Realisierung der One-step-Generierung auf großen Modellen mit selbstadversariellen Flüssen































EditThinker: Iteratives Denken für beliebige Bildbearbeitungsanwendungen freischalten

TwinFlow: Realisierung der One-step-Generierung auf großen Modellen mit selbstadversariellen Flüssen






























CARE-PD: Ein mehrzentrisches anonymisiertes klinisches Datensatz für die Gangbeurteilung bei Parkinson-Patienten
WenetSpeech-Chuan: Ein großes Sichuan-Dialekt-Korpus mit umfassender Annotation für die Dialekt-Sprachverarbeitung
PolypSense3D: Ein Benchmark-Datensatz mit mehreren Quellen für die tiefenbewusste Messung der Polypengröße in der Endoskopie
PhysDrive: Ein multimodales Datensatz für die remote physiologische Messung zur Fahrzeuginternen Fahrerüberwachung
Künstlicher Hivemind: Die offene Homogenität von Sprachmodellen (und darüber hinaus)
OmniSVG: Ein einheitliches, skalierbares Modell zur Generierung von Vektorgrafiken
Theorie des algorithmischen Denkens
Roboter-Weltenmodell: Ein neuronales Netzwerk-Simulator für die robuste Politik-Optimierung in der Robotik
Reward Forcing: Effiziente Streaming-Videoerzeugung mittels belohnungsorientierter Verteilungsübereinstimmungs-Distillation
Semantik leitet den Weg: Harmonisierung von Semantik- und Texturmodellierung mit asynchroner latenter Diffusion
ARM-Thinker: Verstärkung multimodeller generativer Belohnungsmodelle durch agenteilen Werkzeugnutzung und visuelles Schlussfolgern
Nex-N1: Agentenmodelle, die über ein integriertes Ökosystem zur großskaligen Umweltkonstruktion trainiert wurden
DAComp: Benchmarking von Data Agents über den gesamten Data Intelligence-Lebenszyklus
Live Avatar: Echtzeit-Audio-getriebene Avatar-Generierung mit unendlicher Länge
F5-TTS: Ein Märchenerzähler, der fließende und treue Sprache mit Flow-Matching nachahmt
VOccl3D: Ein Video-Benchmark-Datensatz zur 3D-Gestalt- und Körperhaltungsschätzung bei realen Verdeckungen
Alpamayo-R1: Brückenbildung zwischen Schlussfolgern und Aktionssvorhersage für verallgemeinerungsfähiges autonomes Fahren im Long Tail
Alles ist verbunden: Eine Reise durch das Memorieren zur Testzeit, Aufmerksamkeitsbias, Behaltensleistung und Online-Optimierung
Neuüberlegung der Prompt-Design für die Inference-time-Skalierung in Text-zu-Visual-Generierung
Steuerung von Vision-Language-Action-Modellen als Anti-Exploration: Ein Ansatz zur Testzeit-Skalierung
OneThinker: All-in-one Reasoning-Modell für Bild und Video
ViDiC: Video Difference Captioning
PretrainZero: Verstärkungsbasiertes aktives Vortrainieren
Jeder Token zählt: Verallgemeinerung von 16M Ultra-langen Kontexten in großen Sprachmodellen
SimScale: Lernen des Fahrens durch realweltbasierte Simulation in Skalierung
Skywork-R1V4: Hin zum agentenhaften multimodalen Intelligenz durch abwechselndes Denken mit Bildern und DeepResearch
Geführte selbstentwickelnde LLMs mit minimaler menschlicher Aufsicht
MultiShotMaster: Ein steuerbarer Rahmen für die Mehrfach-Aufnahme-Videogenerierung
MG-Nav: Dual-Skalige visuelle Navigation mittels spärlicher räumlicher Memory
Der Consistency Critic: Korrektur von Inkonsistenzen in generierten Bildern mittels referenzgeleiteter aufmerksamer Ausrichtung
CARE-PD: Ein mehrzentrisches anonymisiertes klinisches Datensatz für die Gangbeurteilung bei Parkinson-Patienten
WenetSpeech-Chuan: Ein großes Sichuan-Dialekt-Korpus mit umfassender Annotation für die Dialekt-Sprachverarbeitung
PolypSense3D: Ein Benchmark-Datensatz mit mehreren Quellen für die tiefenbewusste Messung der Polypengröße in der Endoskopie
PhysDrive: Ein multimodales Datensatz für die remote physiologische Messung zur Fahrzeuginternen Fahrerüberwachung
Künstlicher Hivemind: Die offene Homogenität von Sprachmodellen (und darüber hinaus)
OmniSVG: Ein einheitliches, skalierbares Modell zur Generierung von Vektorgrafiken
Theorie des algorithmischen Denkens
Roboter-Weltenmodell: Ein neuronales Netzwerk-Simulator für die robuste Politik-Optimierung in der Robotik
Reward Forcing: Effiziente Streaming-Videoerzeugung mittels belohnungsorientierter Verteilungsübereinstimmungs-Distillation
Semantik leitet den Weg: Harmonisierung von Semantik- und Texturmodellierung mit asynchroner latenter Diffusion
ARM-Thinker: Verstärkung multimodeller generativer Belohnungsmodelle durch agenteilen Werkzeugnutzung und visuelles Schlussfolgern
Nex-N1: Agentenmodelle, die über ein integriertes Ökosystem zur großskaligen Umweltkonstruktion trainiert wurden
DAComp: Benchmarking von Data Agents über den gesamten Data Intelligence-Lebenszyklus
Live Avatar: Echtzeit-Audio-getriebene Avatar-Generierung mit unendlicher Länge
F5-TTS: Ein Märchenerzähler, der fließende und treue Sprache mit Flow-Matching nachahmt
VOccl3D: Ein Video-Benchmark-Datensatz zur 3D-Gestalt- und Körperhaltungsschätzung bei realen Verdeckungen
Alpamayo-R1: Brückenbildung zwischen Schlussfolgern und Aktionssvorhersage für verallgemeinerungsfähiges autonomes Fahren im Long Tail
Alles ist verbunden: Eine Reise durch das Memorieren zur Testzeit, Aufmerksamkeitsbias, Behaltensleistung und Online-Optimierung
Neuüberlegung der Prompt-Design für die Inference-time-Skalierung in Text-zu-Visual-Generierung
Steuerung von Vision-Language-Action-Modellen als Anti-Exploration: Ein Ansatz zur Testzeit-Skalierung
OneThinker: All-in-one Reasoning-Modell für Bild und Video
ViDiC: Video Difference Captioning
PretrainZero: Verstärkungsbasiertes aktives Vortrainieren
Jeder Token zählt: Verallgemeinerung von 16M Ultra-langen Kontexten in großen Sprachmodellen
SimScale: Lernen des Fahrens durch realweltbasierte Simulation in Skalierung
Skywork-R1V4: Hin zum agentenhaften multimodalen Intelligenz durch abwechselndes Denken mit Bildern und DeepResearch
Geführte selbstentwickelnde LLMs mit minimaler menschlicher Aufsicht
MultiShotMaster: Ein steuerbarer Rahmen für die Mehrfach-Aufnahme-Videogenerierung
MG-Nav: Dual-Skalige visuelle Navigation mittels spärlicher räumlicher Memory
Der Consistency Critic: Korrektur von Inkonsistenzen in generierten Bildern mittels referenzgeleiteter aufmerksamer Ausrichtung