Command Palette
Search for a command to run...
Papers
Täglich aktualisierte hochmoderne KI-Forschungsarbeiten, um Sie über die neuesten KI-Trends auf dem Laufenden zu halten
Papers

MOVA: Hin zu skalierbarer und synchroner Video-Audio-Generierung

MemoryLLM: Einsteckbares, interpretierbares Feed-Forward-Gedächtnis für Transformer






























DreamDojo: Ein generalistisches Roboter-Weltmodell aus großskaligen menschlichen Videos
F-GRPO: Lassen Sie Ihre Policy nicht das Offensichtliche lernen und das Seltenen vergessen
MSign: Ein Optimierer zur Vermeidung von Trainingsinstabilität bei großen Sprachmodellen durch stabile Rangwiederherstellung
AudioSAE: Ein Schritt hin zur Verständnis von Audioverarbeitungsmodellen mit sparsen Autoencodern
Zur Entropiedynamik bei der Verstärkungsfine-Tuning großer Sprachmodelle
OdysseyArena: Benchmarking von Großsprachmodellen für langfristige, aktive und induktive Interaktionen
Baichuan-M3: Modellierung klinischer Untersuchungen für zuverlässige medizinische Entscheidungsfindung
Generative Modellierung über Driften
AlphaEdit: Wissenseditierung für Sprachmodelle unter Nullraum-Beschränkung
Lernen des Schließens anhand von 13 Parametern
DFlash: Block Diffusion für Flash-spekulative Decodierung
Context Forcing: Konsistente autoregressive Video-Generierung mit langem Kontext
MemSkill: Lernen und Weiterentwicklung von Gedächtniskompetenzen für sich selbstentwickelnde Agenten
Längenunabhängige Sequenzpolitikoptimierung: Aufdeckung und Kontrolle der Variabilität der Antwortlänge in RLVR
Spider-Sense: Intrinsic Risk Sensing für effiziente Agenten-Abwehr mit hierarchischer adaptiver Screening
CAR-bench: Evaluierung der Konsistenz und limitbewussten Wahrnehmung von LLM-Agenten unter realweltlicher Unsicherheit
Streaming Sequence-to-Sequence Learning mit der Modellierung verzögerter Streams
Kiss3DGen: Umnutzung von Image Diffusion Models zur Generierung von 3D-Assets
Stateful Conformer mit Cache-basierter Inference für Streaming Automatic Speech Recognition
Native und kompakte strukturierte Latents für die 3D-Generierung
Kontinuierliche Audio-Language-Models
Evolution von interaktiven diagnostischen Agents in einer virtuellen klinischen Umgebung
WeDLM: Vereinbarung von Diffusions-Sprachmodellen mit standarder kausaler Aufmerksamkeit für schnelle Inferenz
TurboDiffusion: Beschleunigung von Videodiffusionsmodellen um das 100- bis 200-Fache
HunyuanVideo-Foley: Multimodale Diffusion mit Repräsentationsausrichtung für die Generierung hochwertiger Foley-Audio
Fara-7B: Ein effizienter agenter Modell für den Computerbetrieb
Fun-ASR-Technischer Bericht
Wissenschaftliche Forschung beschleunigen mit Gemini: Fallstudien und gängige Techniken
Skalierung kleiner Agenten durch Strategieauktionen
Vibe AIGC: Ein neuer Paradigma für die Inhaltsgenerierung durch agentele Orchestrierung