Command Palette
Search for a command to run...
Papers
Täglich aktualisierte hochmoderne KI-Forschungsarbeiten, um Sie über die neuesten KI-Trends auf dem Laufenden zu halten

ScreenCoder: Fortschritt bei der visuell-zu-Code-Generierung für die Front-End-Automatisierung durch modulare multimodale Agenten

MIRepNet: Ein Pipelinesystem und Grundmodell zur EEG-basierten Klassifikation motorischer Imagination































ScreenCoder: Fortschritt bei der visuell-zu-Code-Generierung für die Front-End-Automatisierung durch modulare multimodale Agenten

MIRepNet: Ein Pipelinesystem und Grundmodell zur EEG-basierten Klassifikation motorischer Imagination






























ChemDFM-R: Ein chemischer Schlussfolgerungs-LLM, der durch atomisierte chemische Kenntnisse verbessert wurde
X-Omni: Reinforcement Learning macht diskrete autoregressive Bildgenerativmodelle wieder großartig
HunyuanWorld 1.0: Erzeugung immersiver, erkundbarer und interaktiver 3D-Welten aus Worten oder Pixeln
AlphaEarth Foundations: Ein Embedding-Feld-Modell für eine genaue und effiziente globale Kartenerstellung aus spärlichen Etikettendaten
Zu einer langfristigen ENSO-Vorhersage mit einem erklärbaren tiefen Lernmodell
OmniArch: Aufbau eines Grundmodells für wissenschaftliches Rechnen
UI-AGILE: GUI-Agenten mit effektivem Verstärkendem Lernen und präziser Inferenzzeit-Verankerung weiterentwickeln
DualSG: Ein Dual-Stream-Expliciter Semantik-gesteuerter Multivariate Zeitreihenprognose-Rahmenwerk
Wenn Tokens zu viel sprechen: Eine Übersicht über die multimodale Langzeit-Token-Kompression in Bildern, Videos und Audios
SmallThinker: Eine Familie effizienter großer Sprachmodelle, die natively für die lokale Bereitstellung trainiert wurden
Rekonstruktion der 4D räumlichen Intelligenz: Eine Übersicht
Rep-MTL: Die Kraft der Darstellungsebene der Aufgabenrelevanz für Multi-Task Learning
ARC-Hunyuan-Video-7B: Strukturierte Videoverstehen von realen Kurzfilmen
Agente Stärkung der Politik-Optimierung
Spezifikation Self-Correction: Verminderung von In-Context Reward Hacking Durch Testzeit-Verfeinerung
PRIX: Planen aus rohen Pixeln lernen für End-to-End-Autonome Fahrt
MMBench-GUI: Hierarchisches Multi-Plattform-Evaluierungsframework für GUI-Agenten
Deep Researcher mit Test-Time Diffusion
Die Geometrie der LLM-Quantisierung: GPTQ als Babai-Algorithmus des nächsten Ebenen
MedIQA: Ein skalierbares Grundmodell für promptgesteuerte medizinische Bildqualitätsbewertung
OS-MAP: Wie weit können Computer nutzende Agenten in Breite und Tiefe gehen?
Hierarchische Budget-Richtlinien-Optimierung für adaptives Reasoning
Captain Cinema: Towards Short Movie Generation
LAPO: Internalisierung der Recheneffizienz durch längeadaptive Policy-Optimierung
MUR: Momentum Unschärfe gestützte Reasoning für große Sprachmodelle
∇NABLA: Neighborhood Adaptive Block-Level Attention
Gruppenfolgepolitik-Optimierung
SafeWork-R1: Coevolution von Sicherheit und Intelligenz unter dem AI-45-Gesetz
Die Entkoppelung von Wissen und Reasoning in LLMs: Eine Untersuchung unter Verwendung der kognitiven Dual-System-Theorie
Re:Form – Reduzierung menschlicher Vorwissen bei skalierbarer formaler Softwareverifikation mit RL in LLMs: Eine Vorstudie zu Dafny
ChemDFM-R: Ein chemischer Schlussfolgerungs-LLM, der durch atomisierte chemische Kenntnisse verbessert wurde
X-Omni: Reinforcement Learning macht diskrete autoregressive Bildgenerativmodelle wieder großartig
HunyuanWorld 1.0: Erzeugung immersiver, erkundbarer und interaktiver 3D-Welten aus Worten oder Pixeln
AlphaEarth Foundations: Ein Embedding-Feld-Modell für eine genaue und effiziente globale Kartenerstellung aus spärlichen Etikettendaten
Zu einer langfristigen ENSO-Vorhersage mit einem erklärbaren tiefen Lernmodell
OmniArch: Aufbau eines Grundmodells für wissenschaftliches Rechnen
UI-AGILE: GUI-Agenten mit effektivem Verstärkendem Lernen und präziser Inferenzzeit-Verankerung weiterentwickeln
DualSG: Ein Dual-Stream-Expliciter Semantik-gesteuerter Multivariate Zeitreihenprognose-Rahmenwerk
Wenn Tokens zu viel sprechen: Eine Übersicht über die multimodale Langzeit-Token-Kompression in Bildern, Videos und Audios
SmallThinker: Eine Familie effizienter großer Sprachmodelle, die natively für die lokale Bereitstellung trainiert wurden
Rekonstruktion der 4D räumlichen Intelligenz: Eine Übersicht
Rep-MTL: Die Kraft der Darstellungsebene der Aufgabenrelevanz für Multi-Task Learning
ARC-Hunyuan-Video-7B: Strukturierte Videoverstehen von realen Kurzfilmen
Agente Stärkung der Politik-Optimierung
Spezifikation Self-Correction: Verminderung von In-Context Reward Hacking Durch Testzeit-Verfeinerung
PRIX: Planen aus rohen Pixeln lernen für End-to-End-Autonome Fahrt
MMBench-GUI: Hierarchisches Multi-Plattform-Evaluierungsframework für GUI-Agenten
Deep Researcher mit Test-Time Diffusion
Die Geometrie der LLM-Quantisierung: GPTQ als Babai-Algorithmus des nächsten Ebenen
MedIQA: Ein skalierbares Grundmodell für promptgesteuerte medizinische Bildqualitätsbewertung
OS-MAP: Wie weit können Computer nutzende Agenten in Breite und Tiefe gehen?
Hierarchische Budget-Richtlinien-Optimierung für adaptives Reasoning
Captain Cinema: Towards Short Movie Generation
LAPO: Internalisierung der Recheneffizienz durch längeadaptive Policy-Optimierung
MUR: Momentum Unschärfe gestützte Reasoning für große Sprachmodelle
∇NABLA: Neighborhood Adaptive Block-Level Attention
Gruppenfolgepolitik-Optimierung
SafeWork-R1: Coevolution von Sicherheit und Intelligenz unter dem AI-45-Gesetz
Die Entkoppelung von Wissen und Reasoning in LLMs: Eine Untersuchung unter Verwendung der kognitiven Dual-System-Theorie
Re:Form – Reduzierung menschlicher Vorwissen bei skalierbarer formaler Softwareverifikation mit RL in LLMs: Eine Vorstudie zu Dafny