Command Palette
Search for a command to run...
Papers
Täglich aktualisierte hochmoderne KI-Forschungsarbeiten, um Sie über die neuesten KI-Trends auf dem Laufenden zu halten
Papers

DeepSeek-V4: Auf dem Weg zu hocheffizienter Intelligenz mit Millionen-Token-Kontext

Wissen–Geometrie-Entkopplung: Auffrischbarer vortrainierter Transfer für Streaming-Empfehlungssysteme






























Video-DeepResearch: Auf dem Weg zum multimodalen Deep-Research-Agenten der nächsten Generation
AURORA-LM: Autoenkodierende einheitliche Repräsentation für kontinuierlich-latente Diffusions-Sprachmodellierung
Hunyuan3D-Buffalo 1.0: Ein einheitliches multimodales Modell für skalierbare 3D-Generierung, -Verständnis und -Bearbeitung
JoyAI-Video-Edit: Echtzeit-Videobearbeitung ohne Einschränkungen mittels autoregressiver Diffusion
MerchantBench: Benchmarking von LLM-Agenten für langfristige Kohärenz im E-Commerce-Betrieb
Training von nGPT
UEmbed: Vereinheitlichte dünnund dichtbesetzte multimodale Einbettungen
VAD: Visuelle Evidenzattribution zur Zielrekonstruktion in multimodaler On-Policy-Destillation
PROGRESSIVE GENERIERUNG VON AGENTENFÄHIGKEITEN MITTELS BESTÄRKENDEM LERNEN
DAPD: Dual-Anchored Policy Distillation
LongHorizon-Harness: Fortschrittliche Agenten für langfristige Aufgaben in der realen Welt
SwanTale: Einheitliche Multi-Sprecher-Sprachund Audiogenerierung für Instructund Zero-Shot-Aufgaben
Fara-1.5: Skalierbare Lernumgebungen für Computer-Use-Agenten
Docling Technischer Bericht
Von der Hochdurchsatz-Evaluierung zu Nasslaborstudien: Weiterentwicklung der Mutationswirkungsvorhersage mit einem retrieval-gestützten Modell
Modell oder Steuerung? Eine interaktionszentrierte Taxonomie zur Lokalisierung von Agentenfehlern
Induktion von Sprachmodellen zur Behauptung ihres eigenen Bewusstseins stellt menschliche Überzeugungen und Werte wieder her
Diamond: Ein Sequenz-zu-Sequenz-Modell zur Sprachwiederherstellung mittels eines autoregressiven RQ-Transformers über neuronalen Audio-Codec-Tokens
N0-TWAM: Skalierung eines taktil-nativen Welt-Aktionsmodells für kontaktintensive Manipulation
AISPA: Nutzerzentrierte Prüfung von System-Prompts für Large-Language-Model-Anwendungen
Mentale Weltmodellierung
Meshy T2: Schnelle native Mesh-Generierung mit Flow Matching
N0-VTLA: Skalierung eines Vision–Taktil–Sprache–Aktions-Modells mit latenten taktilen Tokens
Von RLVR zu RLSVR: Aufgaben-Transformation induziert selbstverifizierbare Belohnungen für die offene Selbstverbesserung von LLMs
BEACON: WISSEN, WANN UND WIE AGENTISCHES VISUELLES SCHLUSSFOLGERN DURCHZUFÜHREN IST
SkillSmith: Komposition parametrischer Fertigkeiten und textuellen Wissens erlernen
VideoCoCo: Code-as-CoT für physikalisch konsistente Videogenerierung durch ein agentisches Doppelmotorsystem
PHIZERO: EIN WELTMODELL, AUFGEBAUT UM PHYSIKALISCHE SPRACHE
Frontis-MA1: Training eines AI4AI-Modells für rekursive Selbstverbesserung im Machine-Learning-Engineering
Metis: Ein Gedächtnis-Grundlagenmodell