Command Palette
Search for a command to run...
Papers
Täglich aktualisierte hochmoderne KI-Forschungsarbeiten, um Sie über die neuesten KI-Trends auf dem Laufenden zu halten

FlowAnchor: Stabilisierung des Editiersignals für inversion-freies Video-Editing

LLM-Sicherheit von innen heraus: Detektion schädlicher Inhalte mittels interner Repräsentationen































FlowAnchor: Stabilisierung des Editiersignals für inversion-freies Video-Editing

LLM-Sicherheit von innen heraus: Detektion schädlicher Inhalte mittels interner Repräsentationen






























DiffNR: Diffusionsgestützte neuronale Repräsentationsoptimierung für die tomografische 3D-Rekonstruktion mit spärlichen Ansichten
Agentic World Modeling: Grundlagen, Fähigkeiten, Gesetze und darüber hinaus
Entkoppeltes DiLoCo für resilientes verteiltes Pre-training
EVENT TENSOR: EINE VEREINFACHTE ABSTRAKTION ZUR KOMPILIERUNG DYNAMISCHER MEGAKERNEL
Schnelles und langsames Sehen: Erlernen des Zeitflusses in Videos
Ko-evolutionäre LLM-Entscheidungs- und Skill-Bank-Agents für Langzeitaufgaben
StyleID: Ein Wahrnehmungs-orientierter Datensatz und eine Metrik für die stilisierungsunabhängige Erkennung der Gesichtsidealität
UniT: Auf dem Weg zu einer vereinheitlichten physikalischen Sprache für das Human-to-Humanoid Policy Learning und World Modeling
WorldMark: Eine vereinheitlichte Benchmark-Suite für interaktive Video-World-Models
LLaTiSA: In Richtung einer schwierigkeitsschichtbasierten Zeitreihen-Argumentation von der visuellen Wahrnehmung bis zur Semantik
Bildgeneratoren sind Generalist Vision Learners
LongCat-Next: Lexikalisierung von Modalitäten als diskrete Tokens
FIPO: Elicitation von Deep Reasoning durch Future-KL-beeinflusste Policy Optimization
Bootstrapping-Exploration mittels sprachlichem Feedback auf Gruppenebene in Reinforcement Learning
SocialOmni: Benchmarking der audiovisuellen sozialen Interaktivität in Omni-Modellen
DeepSeek-V4: Auf dem Weg zu hocheffizienter Million-Token Context Intelligence
Erforschung der räumlichen Intelligenz aus einer generativen Perspektive
DeVI: Physikbasiertes geschicktes Mensch-Objekt-Interaktionsverhalten durch synthetische Videoimitation
Reward Hacking im Zeitalter großer Modelle: Mechanismen, emergente Fehlbeurteilungen (Misalignment) und Herausforderungen
DR-Venus: Hin zu frontier-orientierten Deep Research Agents im Edge-Scale-Bereich mit nur 10K Open Data
Optimierung der Policy in der nahen Zukunft
LLaDA2.0-Uni: Vereinheitlichung von multimodaler Verständnis- und Generierungsleistung mittels eines Diffusion Large Language Model
BioInstruct: Instruction Tuning von Large Language Models für die biomedizinische natürliche Sprachverarbeitung
Technischer Bericht zu Logics-Parsing-Omni
Task Tokens: Ein flexibler Ansatz zur Anpassung von Behavior Foundation Models
PlayCoder: Playability von LLM-generiertem GUI-Code ermöglichen
TEMPO: Skalierung des Test-time Training für Large Reasoning Models
AnyRecon: Beliebige 3D-Rekonstruktion mittels eines Video-Diffusionsmodells
AgentSPEX: Eine Agent SPecification and EXecution Language
CoInteract: Physikalisch konsistente Video-Synthese von Human-Object-Interaktionen durch räumlich strukturierte Co-Generierung
DiffNR: Diffusionsgestützte neuronale Repräsentationsoptimierung für die tomografische 3D-Rekonstruktion mit spärlichen Ansichten
Agentic World Modeling: Grundlagen, Fähigkeiten, Gesetze und darüber hinaus
Entkoppeltes DiLoCo für resilientes verteiltes Pre-training
EVENT TENSOR: EINE VEREINFACHTE ABSTRAKTION ZUR KOMPILIERUNG DYNAMISCHER MEGAKERNEL
Schnelles und langsames Sehen: Erlernen des Zeitflusses in Videos
Ko-evolutionäre LLM-Entscheidungs- und Skill-Bank-Agents für Langzeitaufgaben
StyleID: Ein Wahrnehmungs-orientierter Datensatz und eine Metrik für die stilisierungsunabhängige Erkennung der Gesichtsidealität
UniT: Auf dem Weg zu einer vereinheitlichten physikalischen Sprache für das Human-to-Humanoid Policy Learning und World Modeling
WorldMark: Eine vereinheitlichte Benchmark-Suite für interaktive Video-World-Models
LLaTiSA: In Richtung einer schwierigkeitsschichtbasierten Zeitreihen-Argumentation von der visuellen Wahrnehmung bis zur Semantik
Bildgeneratoren sind Generalist Vision Learners
LongCat-Next: Lexikalisierung von Modalitäten als diskrete Tokens
FIPO: Elicitation von Deep Reasoning durch Future-KL-beeinflusste Policy Optimization
Bootstrapping-Exploration mittels sprachlichem Feedback auf Gruppenebene in Reinforcement Learning
SocialOmni: Benchmarking der audiovisuellen sozialen Interaktivität in Omni-Modellen
DeepSeek-V4: Auf dem Weg zu hocheffizienter Million-Token Context Intelligence
Erforschung der räumlichen Intelligenz aus einer generativen Perspektive
DeVI: Physikbasiertes geschicktes Mensch-Objekt-Interaktionsverhalten durch synthetische Videoimitation
Reward Hacking im Zeitalter großer Modelle: Mechanismen, emergente Fehlbeurteilungen (Misalignment) und Herausforderungen
DR-Venus: Hin zu frontier-orientierten Deep Research Agents im Edge-Scale-Bereich mit nur 10K Open Data
Optimierung der Policy in der nahen Zukunft
LLaDA2.0-Uni: Vereinheitlichung von multimodaler Verständnis- und Generierungsleistung mittels eines Diffusion Large Language Model
BioInstruct: Instruction Tuning von Large Language Models für die biomedizinische natürliche Sprachverarbeitung
Technischer Bericht zu Logics-Parsing-Omni
Task Tokens: Ein flexibler Ansatz zur Anpassung von Behavior Foundation Models
PlayCoder: Playability von LLM-generiertem GUI-Code ermöglichen
TEMPO: Skalierung des Test-time Training für Large Reasoning Models
AnyRecon: Beliebige 3D-Rekonstruktion mittels eines Video-Diffusionsmodells
AgentSPEX: Eine Agent SPecification and EXecution Language
CoInteract: Physikalisch konsistente Video-Synthese von Human-Object-Interaktionen durch räumlich strukturierte Co-Generierung