Command Palette
Search for a command to run...
Papers
Täglich aktualisierte hochmoderne KI-Forschungsarbeiten, um Sie über die neuesten KI-Trends auf dem Laufenden zu halten
Papers

QuCo-RAG: Quantifizierung von Unsicherheit aus dem Pre-Training-Korpus für dynamische Retrieval-augmentierte Generierung

Die Prismenhypothese: Harmonisierung semantischer und Pixel-Darstellungen mittels einheitlicher Autoencoding






























Med-Banana-50K: Ein multimodales, großskaliges Datensatz für textgesteuerte medizinische Bildbearbeitung
Kascade: Eine praktische spärliche Aufmerksamkeitsmethode für die Long-Context-LLM-Inferenz
GLM-4.5: Agentic, Reasoning und Coding (ARC) Grundmodelle
GroundingME: Aufdeckung der visuellen Grundierungslücke in MLLMs durch eine mehrdimensionale Bewertung
Sowohl Semantik als auch Rekonstruktion sind wichtig: Darstellungscodierer für die Text-zu-Bild-Generierung und -Bearbeitung optimieren
4D-RGPT: Ein Schritt hin zu einer regionenbasierten 4D-Wahrnehmung durch perceptuelle Distanzierung
Seed-Prover 1.5: Meistern des Beweisens von Theoremen auf Bachelor-Niveau durch Lernen aus Erfahrung
Wenn das Reasoning seinen Gesetzen begegnet
Untersuchung der wissenschaftlichen Allgemeint intelligence von LLMs mittels wissenschaftlerausgerichteter Workflows
K2-V2: Ein 360-Offenes, reasoning-optimiertes LLM
VenusBench-GD: Ein umfassender Multi-Plattform-GUI-Benchmark für vielfältige Grundlagenaufgaben
MCIF: Multimodales, mehrsprachiges Benchmark für Anweisungsfolge aus wissenschaftlichen Vorträgen
NitroGen: Ein offenes Grundmodell für allgemeine Spielen-Agents
H-Neuronen: Über das Vorhandensein, die Wirkung und den Ursprung von Halluzinationsassoziierten Neuronen in LLMs
Die Welt ist Ihre Leinwand: Malen von anpassbaren Ereignissen mit Referenzbildern, Trajektorien und Text
Alchemist: Effizienzsteigerung beim Training von Text-zu-Bild-Modellen durch Meta-Gradienten-basierte Datenauswahl
Tiefe beliebige Panoramen: Ein Grundmodell für die Panoramatiefe-Schätzung
Generatives Refokussieren: Flexible Unschärfekontrolle aus einem einzigen Bild
StereoPilot: Lernen einer einheitlichen und effizienten Stereo-Umwandlung mittels generativer Prioris
Nächste-Embedding-Vorhersage macht starke Vision-Lerner
Agenten-KI: Eine Untersuchung der Horizonte multimodaler Interaktion
Künstlicher Intellekt als mathematischer Partner zur Förderung mathematischer Entdeckungen – Eine Fallstudie zur Homogenisierungstheorie
GenEval 2: Behandlung von Benchmark-Drift bei der Text-zu-Bild-Evaluation
PrivateXR: Der Schutz vor Datenschutzangriffen im Extended Reality durch erklärbare KI-gesteuerte differenzielle Privatsphäre
Temporale Reibungen und gerichtliche Ergebnisse: Analyse des Einflusses von Zeitverzögerungen auf die Strafzumessung in Cook County (2020–2024)
Meta-RL fördert die Exploration bei Sprach-Agenten
LLMCache: schichtweite Caching-Strategien zur beschleunigten Wiederverwendung bei der Transformer-Inferenz
OPENTOUCH: Vollflächige Berührung für die reale Interaktion bringen
VideoRewardBench: Umfassende Bewertung multimodaler Belohnungsmodelle für das Videoverstehen
Soul: Leben in digitale Menschen für hochauflösende, langfristige multimodale Animation einhauchen