Command Palette
Search for a command to run...
Papers
Täglich aktualisierte hochmoderne KI-Forschungsarbeiten, um Sie über die neuesten KI-Trends auf dem Laufenden zu halten
Papers

DynamicVLA: Ein Vision-Language-Action-Modell für die Manipulation dynamischer Objekte

MMFineReason: Schließen der Multimodalen-Reasoning-Lücke durch datenzentrierte offene Methoden






























OCRVerse: Ein Schritt hin zu einer umfassenden OCR in end-to-end Vision-Language-Modellen
Skalierung von Embeddings übertrifft die Skalierung von Experten in Sprachmodellen
Idea2Story: Ein automatisierter Pipeline zur Umwandlung von Forschungskonzepten in vollständige wissenschaftliche Erzählungen
Alles an seinem Platz: Benchmarking der räumlichen Intelligenz von Text-zu-Bild-Modellen
Qwen3-ASR-Technischer Bericht
Insight-Agenten: Ein auf LLM basierendes Multi-Agenten-System für Dateninsights
Zum pixelgenauen VLM-Wahrnehmung durch einfache Punktsvorhersage
Youtu-VL: Freisetzen des visuellen Potenzials durch einheitliche visionssprachliche Aufsicht
Innovator-VL: Ein multimodales Großsprachmodell für wissenschaftliche Entdeckungen
Fortschritt bei Open-Source-Weltmodellen
Schwieriger ist besser: Steigerung der mathematischen Schlussfolgerung durch schwierigkeitsbewusste GRPO und mehrdimensionale Umformulierung von Fragen
Kurzzeitiges Fenster-Attention ermöglicht langfristige Speicherung
World Craft: Agenter Rahmenwerk zur Erstellung von visualisierbaren Welten über Text
Visuelle Generierung entfesselt menschenähnliches Schlussfolgern durch multimodale Weltmodelle
Masked Depth Modeling für räumliches Wahrnehmen
Ein pragmatisches VLA-Grundmodell
AdaReasoner: Dynamische Tool-Orchestrierung für iterative visuelle Reasoning
AgentDoG: Ein diagnostisches Schutzrahmen-Modell für die Sicherheit und Sicherheit von KI-Agenten
TECHNISCHER BERICHT DER ARCEE TRINITY GROßE
Lernmodelle, die sich selbst beibringen: Schlussfolgern am Rande der Lernbarkeit
ATLAS: Adaptive Transfer Scaling Laws für multilinguale Vortrainierung, Feintuning und Dekodierung des Fluches der Multilingualität
iFSQ: Verbesserung von FSQ für die Bildgenerierung mit einer Zeile Code
Elastische Aufmerksamkeit: Testzeit-adaptive Sparsitätsraten für effiziente Transformers
Wissenschaftliche Bildsynthese: Benchmarking, Methoden und nachgeschaltete Nutzenstelle
Der Script ist alles, was Sie brauchen: Ein agenter Rahmen für die Generierung von Langzeitdialog-zu-Kinofilm-Video
daVinci-Dev: Agent-native Mid-training für die Softwareentwicklung
Können LLMs Ihre Durcheinander aufräumen? Eine Übersicht über anwendungsreife Datenbereinigung mit LLMs
DeepSeek-OCR 2: Visueller kausaler Fluss
Lernen, zur Testzeit zu entdecken
Hervorbringen schädlicher Fähigkeiten durch Feintuning an geschützten Ausgaben