Command Palette
Search for a command to run...
Papers
Täglich aktualisierte hochmoderne KI-Forschungsarbeiten, um Sie über die neuesten KI-Trends auf dem Laufenden zu halten

HiStream: Effiziente Erzeugung hochauflösender Videos durch redundanzeliminiertes Streaming

TokSuite: Die Messung des Einflusses der Tokenisierungsstrategie auf das Verhalten von Sprachmodellen































HiStream: Effiziente Erzeugung hochauflösender Videos durch redundanzeliminiertes Streaming

TokSuite: Die Messung des Einflusses der Tokenisierungsstrategie auf das Verhalten von Sprachmodellen






























Nemotron 3 Nano: Open, effizienter Mixture-of-Experts-Hybrid-Mamba-Transformer-Modell für agenzentisches Reasoning
Jenseits der Speicherung: Ein multimodales ordinal-regressives Benchmark zur Aufdeckung von Popularitätsbias in Vision-Language-Modellen
DreaMontage: Frame-gesteuerte One-Shot-Videoerzeugung mit beliebigen Rahmen
T2AV-Compass: Hin zu einer einheitlichen Bewertung für Text-zu-Audio-Video-Generierung
TongSIM: Eine allgemeine Plattform zur Simulation intelligenter Maschinen
Qwen-Image-Layered: Ein Weg zur inhärenten Editierbarkeit durch Schichtdekomposition
RoboSafe: Sicherung körperhafter Agenten durch ausführbare Sicherheitslogik
Evaluierung der Sicherheit von Arzneimitteln durch große Sprachmodelle in der praktischen Anwendung im primären Gesundheitswesen der NHS
Mehrfach-LLM-Thematische Analyse mit dualen Zuverlässigkeitsmetriken: Kombination von Cohens Kappa und semantischer Ähnlichkeit zur Validierung qualitativer Forschung
Aktive Intelligenz in Videogavataren durch geschlossenen Schleifen-Weltmodellierung
FaithLens: Erkennung und Erklärung von Treue-Halluzinationen
SAM Audio: Segmentieren von Allem im Audio
Schritt-DeepResearch Technischer Bericht
SpatialTree: Wie räumliche Fähigkeiten in MLLMs verzweigen
SemanticGen: Videoerzeugung im semantischen Raum
Automatisierte stereotaktische Radiosurgery-Planung unter Verwendung eines menschlich-im-Loop-Reasoning-Modells mit großer Sprachagenten
LongVideoAgent: Multi-Agent-Reasoning mit langen Videos
GenEnv: Schwierigkeitsausgeglichene ko-evolutionäre Entwicklung von LLM-Agenten und Umgebungssimulatoren
WorldWarp: Propagieren von 3D-Geometrie mit asynchroner Video-Diffusion
LoGoPlanner: Lokalisierungsgestützte Navigationspolitik mit metrikbewusster visueller Geometrie
Können LLMs das Schwierigkeitsniveau von Lernenden abschätzen? Mensch-AI-Übereinstimmung der Schwierigkeit durch Profizienz-Simulation zur Vorhersage der Item-Schwierigkeit
QuCo-RAG: Quantifizierung von Unsicherheit aus dem Pre-Training-Korpus für dynamische Retrieval-augmentierte Generierung
Die Prismenhypothese: Harmonisierung semantischer und Pixel-Darstellungen mittels einheitlicher Autoencoding
Med-Banana-50K: Ein multimodales, großskaliges Datensatz für textgesteuerte medizinische Bildbearbeitung
Kascade: Eine praktische spärliche Aufmerksamkeitsmethode für die Long-Context-LLM-Inferenz
GLM-4.5: Agentic, Reasoning und Coding (ARC) Grundmodelle
GroundingME: Aufdeckung der visuellen Grundierungslücke in MLLMs durch eine mehrdimensionale Bewertung
Sowohl Semantik als auch Rekonstruktion sind wichtig: Darstellungscodierer für die Text-zu-Bild-Generierung und -Bearbeitung optimieren
4D-RGPT: Ein Schritt hin zu einer regionenbasierten 4D-Wahrnehmung durch perceptuelle Distanzierung
Seed-Prover 1.5: Meistern des Beweisens von Theoremen auf Bachelor-Niveau durch Lernen aus Erfahrung
Nemotron 3 Nano: Open, effizienter Mixture-of-Experts-Hybrid-Mamba-Transformer-Modell für agenzentisches Reasoning
Jenseits der Speicherung: Ein multimodales ordinal-regressives Benchmark zur Aufdeckung von Popularitätsbias in Vision-Language-Modellen
DreaMontage: Frame-gesteuerte One-Shot-Videoerzeugung mit beliebigen Rahmen
T2AV-Compass: Hin zu einer einheitlichen Bewertung für Text-zu-Audio-Video-Generierung
TongSIM: Eine allgemeine Plattform zur Simulation intelligenter Maschinen
Qwen-Image-Layered: Ein Weg zur inhärenten Editierbarkeit durch Schichtdekomposition
RoboSafe: Sicherung körperhafter Agenten durch ausführbare Sicherheitslogik
Evaluierung der Sicherheit von Arzneimitteln durch große Sprachmodelle in der praktischen Anwendung im primären Gesundheitswesen der NHS
Mehrfach-LLM-Thematische Analyse mit dualen Zuverlässigkeitsmetriken: Kombination von Cohens Kappa und semantischer Ähnlichkeit zur Validierung qualitativer Forschung
Aktive Intelligenz in Videogavataren durch geschlossenen Schleifen-Weltmodellierung
FaithLens: Erkennung und Erklärung von Treue-Halluzinationen
SAM Audio: Segmentieren von Allem im Audio
Schritt-DeepResearch Technischer Bericht
SpatialTree: Wie räumliche Fähigkeiten in MLLMs verzweigen
SemanticGen: Videoerzeugung im semantischen Raum
Automatisierte stereotaktische Radiosurgery-Planung unter Verwendung eines menschlich-im-Loop-Reasoning-Modells mit großer Sprachagenten
LongVideoAgent: Multi-Agent-Reasoning mit langen Videos
GenEnv: Schwierigkeitsausgeglichene ko-evolutionäre Entwicklung von LLM-Agenten und Umgebungssimulatoren
WorldWarp: Propagieren von 3D-Geometrie mit asynchroner Video-Diffusion
LoGoPlanner: Lokalisierungsgestützte Navigationspolitik mit metrikbewusster visueller Geometrie
Können LLMs das Schwierigkeitsniveau von Lernenden abschätzen? Mensch-AI-Übereinstimmung der Schwierigkeit durch Profizienz-Simulation zur Vorhersage der Item-Schwierigkeit
QuCo-RAG: Quantifizierung von Unsicherheit aus dem Pre-Training-Korpus für dynamische Retrieval-augmentierte Generierung
Die Prismenhypothese: Harmonisierung semantischer und Pixel-Darstellungen mittels einheitlicher Autoencoding
Med-Banana-50K: Ein multimodales, großskaliges Datensatz für textgesteuerte medizinische Bildbearbeitung
Kascade: Eine praktische spärliche Aufmerksamkeitsmethode für die Long-Context-LLM-Inferenz
GLM-4.5: Agentic, Reasoning und Coding (ARC) Grundmodelle
GroundingME: Aufdeckung der visuellen Grundierungslücke in MLLMs durch eine mehrdimensionale Bewertung
Sowohl Semantik als auch Rekonstruktion sind wichtig: Darstellungscodierer für die Text-zu-Bild-Generierung und -Bearbeitung optimieren
4D-RGPT: Ein Schritt hin zu einer regionenbasierten 4D-Wahrnehmung durch perceptuelle Distanzierung
Seed-Prover 1.5: Meistern des Beweisens von Theoremen auf Bachelor-Niveau durch Lernen aus Erfahrung