Command Palette
Search for a command to run...
Papers
Täglich aktualisierte hochmoderne KI-Forschungsarbeiten, um Sie über die neuesten KI-Trends auf dem Laufenden zu halten

Nemotron-Cascade: Skalierung kaskadierter Verstärkungslernverfahren für allgemeinzweckorientierte Reasoning-Modelle

KlingAvatar 2.0 Technischer Bericht































Nemotron-Cascade: Skalierung kaskadierter Verstärkungslernverfahren für allgemeinzweckorientierte Reasoning-Modelle

KlingAvatar 2.0 Technischer Bericht






























QwenLong-L1.5: Nachtrainingsrezept für langfristige Schlussfolgerung und Gedächtnisverwaltung
ReFusion: Ein Diffusions-LLM mit paralleler autoregressiver Dekodierung
Error-Free Linear Attention ist ein kostenloses Mittagessen: Exakte Lösung aus kontinuierlichen Zeitdynamiken
Gedächtnis im Zeitalter von AI-Agenten
LongVie 2: Multimodales steuerbares Ultra-Langes-Video-Weltmodell
FirstAidQA: Ein synthetischer Datensatz für Erste Hilfe und Notfallreaktionen in Umgebungen mit geringer Netzwerkverbindung
CUDA-L2: Überbieten der cuBLAS-Leistung für Matrixmultiplikation durch Verstärkungslernen
X-VLA: Soft-Prompt-basierter Transformer als skalierbarer cross-Embodiment Vision-Language-Action-Modell
Nemotron 3 Nano: Offenes, effizientes Mixture-of-Experts-Hybrid-Modell aus Mamba-Transformer für agenzienbasiertes Schlussfolgern
Structure From Tracking: Struktur erhaltende Bewegungsdistanzierung für die Videogenerierung
Untersuchung des Informationstransfers zwischen MLLM und Diffusion mit MetaCanvas
PersonaLive! Ausdrucksstarke Animation von Porträtfotos für Live-Streaming
V-RGBX: Video-Editierung mit präzisen Steuerungsoptionen für intrinsische Eigenschaften
SVG-T2I: Skalierung des Text-zu-Bild-Latent-Diffusionsmodells ohne Variationalen Autoencoder
DentalGPT: Anreizschaffung für multimodales komplexes Schlussfolgern in der Zahnmedizin
SSRB: Direkte Abfrage natürlicher Sprache für große heterogene semi-strukturierte Daten
MUVR: Ein Multi-Modales Benchmark für ungeschnittene Video-Abfrage mit Multi-Level-Visueller Korrespondenz
Bewertung von Gemini-Roboterpolitiken in einem Veo-Welten-Simulator
MotionEdit: Benchmarking und Lernen von bewegungsorientierter Bildbearbeitung
Erreichen eines Olympia-Niveau-Geometrie-LLM-Agenten durch Komplexitätsverstärkendes Verstärkungslernen
OPV: outcomebasiertes Prozessverifizierungsverfahren für eine effiziente lange Ketten-des-Denkens-Verifizierung
Sind wir bereit für RL in der Text-zu-3D-Generierung? Eine progressive Untersuchung
Langfristiges Schlussfolgerungs-Agentensystem zur Lösung olympiadeähnlicher mathematischer Probleme
T-pro 2.0: Ein effizienter russischer Hybrid-Reasoning-Modell und Spielplatz
AutoGLM: Autonome Grundagenten für GUIs
OpenGU: Ein umfassender Benchmark für Graph-Entlernverfahren
Zur Wechselwirkung von Pre-Training, Mid-Training und RL bei reasoningfähigen Sprachmodellen
DeepCode: Offene agente Codierung
InfiniteVL: Synergie aus linearer und sparser Aufmerksamkeit für hoch-effiziente, unbegrenzte Eingabevision-sprachliche Modelle
OmniPSD: Layered PSD Generation with Diffusion Transformer
QwenLong-L1.5: Nachtrainingsrezept für langfristige Schlussfolgerung und Gedächtnisverwaltung
ReFusion: Ein Diffusions-LLM mit paralleler autoregressiver Dekodierung
Error-Free Linear Attention ist ein kostenloses Mittagessen: Exakte Lösung aus kontinuierlichen Zeitdynamiken
Gedächtnis im Zeitalter von AI-Agenten
LongVie 2: Multimodales steuerbares Ultra-Langes-Video-Weltmodell
FirstAidQA: Ein synthetischer Datensatz für Erste Hilfe und Notfallreaktionen in Umgebungen mit geringer Netzwerkverbindung
CUDA-L2: Überbieten der cuBLAS-Leistung für Matrixmultiplikation durch Verstärkungslernen
X-VLA: Soft-Prompt-basierter Transformer als skalierbarer cross-Embodiment Vision-Language-Action-Modell
Nemotron 3 Nano: Offenes, effizientes Mixture-of-Experts-Hybrid-Modell aus Mamba-Transformer für agenzienbasiertes Schlussfolgern
Structure From Tracking: Struktur erhaltende Bewegungsdistanzierung für die Videogenerierung
Untersuchung des Informationstransfers zwischen MLLM und Diffusion mit MetaCanvas
PersonaLive! Ausdrucksstarke Animation von Porträtfotos für Live-Streaming
V-RGBX: Video-Editierung mit präzisen Steuerungsoptionen für intrinsische Eigenschaften
SVG-T2I: Skalierung des Text-zu-Bild-Latent-Diffusionsmodells ohne Variationalen Autoencoder
DentalGPT: Anreizschaffung für multimodales komplexes Schlussfolgern in der Zahnmedizin
SSRB: Direkte Abfrage natürlicher Sprache für große heterogene semi-strukturierte Daten
MUVR: Ein Multi-Modales Benchmark für ungeschnittene Video-Abfrage mit Multi-Level-Visueller Korrespondenz
Bewertung von Gemini-Roboterpolitiken in einem Veo-Welten-Simulator
MotionEdit: Benchmarking und Lernen von bewegungsorientierter Bildbearbeitung
Erreichen eines Olympia-Niveau-Geometrie-LLM-Agenten durch Komplexitätsverstärkendes Verstärkungslernen
OPV: outcomebasiertes Prozessverifizierungsverfahren für eine effiziente lange Ketten-des-Denkens-Verifizierung
Sind wir bereit für RL in der Text-zu-3D-Generierung? Eine progressive Untersuchung
Langfristiges Schlussfolgerungs-Agentensystem zur Lösung olympiadeähnlicher mathematischer Probleme
T-pro 2.0: Ein effizienter russischer Hybrid-Reasoning-Modell und Spielplatz
AutoGLM: Autonome Grundagenten für GUIs
OpenGU: Ein umfassender Benchmark für Graph-Entlernverfahren
Zur Wechselwirkung von Pre-Training, Mid-Training und RL bei reasoningfähigen Sprachmodellen
DeepCode: Offene agente Codierung
InfiniteVL: Synergie aus linearer und sparser Aufmerksamkeit für hoch-effiziente, unbegrenzte Eingabevision-sprachliche Modelle
OmniPSD: Layered PSD Generation with Diffusion Transformer