Command Palette
Search for a command to run...
Papers
Täglich aktualisierte hochmoderne KI-Forschungsarbeiten, um Sie über die neuesten KI-Trends auf dem Laufenden zu halten

EvalVerse: Pipeline-bewusstes und Expertenkalibriertes Benchmarking für professionelle filmische Video-Generierung

MobileGym: Eine verifizierbare und hochparallele Simulationsplattform für die Mobile-GUI-Agent-Forschung































EvalVerse: Pipeline-bewusstes und Expertenkalibriertes Benchmarking für professionelle filmische Video-Generierung

MobileGym: Eine verifizierbare und hochparallele Simulationsplattform für die Mobile-GUI-Agent-Forschung






























SpatialBench: Ist Ihr räumliches Grundlagenmodell ein Allrounder?
LocateAnything: Schnelle und hochwertige Visions-Sprache-Verankerung mit paralleler Box-Decodierung
Gemini Embedding 2: Ein nativer multimodaler Embedding-Model aus Gemini
Sprachmodelle brauchen Schlaf
ECHO: Terminal Agents lernen Weltmodelle kostenlos
ParaVT: Zähmung des Tool-Prior-Paradoxons für paralleles Tool-Use in agenticem Video-Reinforcement-Learning
TriSplat: Simulationsbereite, vorwärtsgerichtete 3D-Szenenrekonstruktion
Foundation Protocol: Eine Koordinierungsschicht für die agentic Gesellschaft
WBench: Ein umfassender Multi-Turn-Benchmark zur Bewertung interaktiver Video-World-Modelle
Macaron-A2UI: Ein Modell für generatives UI in persönlichen Agenten
DVAO: Dynamische Varianz-adaptive Vorteilsoptimierung für Multi-Reinforcement-Learning
ViMU: Benchmarking Video Metaphorical Understanding
SMOL: Professionell übersetzte parallele Daten für 115 unterrepräsentierte Sprachen
Chi-Bench: Können KI-Agenten end-to-End-Prozesse in der Gesundheitsversorgung mit langer Horizontdauer und hoher Politikhäufigkeit automatisieren?
Kombination von On-Policy-Optimierung und Distillation für langkontextuelle Schlussfolgerungen in großen Sprachmodellen
Durch den Blickwinkel des Kontrasts: Selbstverbessernde visuelle Schlussfolgerung in VLMs
HRM-Text: Effizientes Pretraining jenseits des Skalierens
Sehen, was ich meine: Ausrichten von Vision- und Sprachrepräsentationen für das feinkörnige Objektverständnis in Videos
Technischer Bericht zu StepAudio 2.5
SciAtlas: Ein wissensgraph im großen Maßstab für die automatisierte wissenschaftliche Forschung
Neubewertung der cross-layer Informationsrouting in Diffusion Transformers
Lens: Überdenken der Trainings-Effizienz für fundamentale Text-zu-Bild-Modelle
SkillOpt: Exekutive Strategie für sich selbst entwickelnde Agenten-Fähigkeiten
CVEvolve: Autonome Algorithmenentwicklung für die Verarbeitung unstrukturierter wissenschaftlicher Daten
Poly-EPO: Training explorative Modellierungsansätze
Zusammenfassung
ACC: Kompilieren von Agenten-Trajektorien für das Training mit langem Kontext
Volle Aufmerksamkeit schlägt zurück: Übertragung von voller Aufmerksamkeit auf Sparse innerhalb von hundert Trainingsschritten
π-Bench: Evaluierung proaktiver persönlicher Assistenten-Agents in langfristigen Workflows
Wahrnehmung oder Vorurteil: Können MLLMs über erste Eindrücke der Persönlichkeit hinausgehen?
SpatialBench: Ist Ihr räumliches Grundlagenmodell ein Allrounder?
LocateAnything: Schnelle und hochwertige Visions-Sprache-Verankerung mit paralleler Box-Decodierung
Gemini Embedding 2: Ein nativer multimodaler Embedding-Model aus Gemini
Sprachmodelle brauchen Schlaf
ECHO: Terminal Agents lernen Weltmodelle kostenlos
ParaVT: Zähmung des Tool-Prior-Paradoxons für paralleles Tool-Use in agenticem Video-Reinforcement-Learning
TriSplat: Simulationsbereite, vorwärtsgerichtete 3D-Szenenrekonstruktion
Foundation Protocol: Eine Koordinierungsschicht für die agentic Gesellschaft
WBench: Ein umfassender Multi-Turn-Benchmark zur Bewertung interaktiver Video-World-Modelle
Macaron-A2UI: Ein Modell für generatives UI in persönlichen Agenten
DVAO: Dynamische Varianz-adaptive Vorteilsoptimierung für Multi-Reinforcement-Learning
ViMU: Benchmarking Video Metaphorical Understanding
SMOL: Professionell übersetzte parallele Daten für 115 unterrepräsentierte Sprachen
Chi-Bench: Können KI-Agenten end-to-End-Prozesse in der Gesundheitsversorgung mit langer Horizontdauer und hoher Politikhäufigkeit automatisieren?
Kombination von On-Policy-Optimierung und Distillation für langkontextuelle Schlussfolgerungen in großen Sprachmodellen
Durch den Blickwinkel des Kontrasts: Selbstverbessernde visuelle Schlussfolgerung in VLMs
HRM-Text: Effizientes Pretraining jenseits des Skalierens
Sehen, was ich meine: Ausrichten von Vision- und Sprachrepräsentationen für das feinkörnige Objektverständnis in Videos
Technischer Bericht zu StepAudio 2.5
SciAtlas: Ein wissensgraph im großen Maßstab für die automatisierte wissenschaftliche Forschung
Neubewertung der cross-layer Informationsrouting in Diffusion Transformers
Lens: Überdenken der Trainings-Effizienz für fundamentale Text-zu-Bild-Modelle
SkillOpt: Exekutive Strategie für sich selbst entwickelnde Agenten-Fähigkeiten
CVEvolve: Autonome Algorithmenentwicklung für die Verarbeitung unstrukturierter wissenschaftlicher Daten
Poly-EPO: Training explorative Modellierungsansätze
Zusammenfassung
ACC: Kompilieren von Agenten-Trajektorien für das Training mit langem Kontext
Volle Aufmerksamkeit schlägt zurück: Übertragung von voller Aufmerksamkeit auf Sparse innerhalb von hundert Trainingsschritten
π-Bench: Evaluierung proaktiver persönlicher Assistenten-Agents in langfristigen Workflows
Wahrnehmung oder Vorurteil: Können MLLMs über erste Eindrücke der Persönlichkeit hinausgehen?