Command Palette
Search for a command to run...
Papers
Täglich aktualisierte hochmoderne KI-Forschungsarbeiten, um Sie über die neuesten KI-Trends auf dem Laufenden zu halten

Multiplayer-Nash-Präferenz-Optimierung

StableToken: Ein geräuschrobuster semantischer Sprachtokenisierer für resiliente Sprach-LLMs































Multiplayer-Nash-Präferenz-Optimierung

StableToken: Ein geräuschrobuster semantischer Sprachtokenisierer für resiliente Sprach-LLMs






























SLA: Über die Sparsität in Diffusions-Transformern hinaus durch feinabstimmbare sparse-lineare Aufmerksamkeit
SimpleFold: Die Faltung von Proteinen ist einfacher, als Sie denken
POINTS-Reader: Adaptierung von visuell-sprachlichen Modellen für die Dokumentenkonvertierung ohne Distillation
Allgemein gültige geometrische Synthese von Bildunterschriften
Vorteile und Fallen der Verstärkungslernens für die Planung von Sprachmodellen: Eine theoretische Perspektive
Schätzung der Befähigung von Sprachmodell-Agenten
Sprachmodelle können aus verbalen Rückmeldungen lernen, ohne skalarwertige Belohnungen zu erhalten
Variationales Schließen für Sprachmodelle
EPO: Entropieregelisierte Politikoptimierung für LLM-Agenten Verstärkendes Lernen
MinerU2.5: Ein entkoppeltes visuell-sprachliches Modell zur effizienten Verarbeitung hochauflösender Dokumente
Quantils-Vorteils-Schätzung für entropiesicheres Schließen
LongLive: Echtzeit-Interaktive Generierung langer Videos
Kombinatorische Kreativität: Eine neue Front in den Verallgemeinerungsfähigkeiten
Kausale räumlich-zeitliche Vorhersage: Ein effektiver und effizienter multimodaler Ansatz
Hunyuan3D-Omni: Ein einheitlicher Rahmen für die steuerbare Generierung von 3D-Ressourcen
Seedream 4.0: Bemühen um die nächste Generation der multimodalen Bildgenerierung
Baumsuche für die Verstärkungslernung von LLM-Agenten
SciReasoner: Legen der wissenschaftlichen Schlussfolgerungsgrundlage über Disziplinen hinweg
MMR1: Verbesserung multimodaler Schlussfolgerung durch varianzbehaftetes Sampling und offene Ressourcen
VCRL: varianzbasierendes Curriculum-Verstärkungslernen für große Sprachmodelle
MultiEdit: Fortschritte bei der anweisungsbezogenen Bildbearbeitung bei vielfältigen und anspruchsvollen Aufgaben
BRISC: Annotationierte Datensatz für die Segmentierung und Klassifizierung von Gehirntumoren mit Swin-HAFNet
EmoBench-M: Benchmarking der emotionalen Intelligenz für multimodale große Sprachmodelle
FDABench: Ein Benchmark für Daten-Agenten bei analytischen Abfragen über heterogene Daten
Einfacheres Malen als Denken: Können Text-zu-Bild-Modelle die Bühne bereiten, aber nicht das Spiel leiten?
UniVerse-1: Unified Audio-Video Generation durch Stitching von Experten
Wie gut sind Grundmodelle bei schrittweiser verkörperte Schlussfolgerung?
SpikingBrain-Technischer Bericht: Spiking Brain-inspirierte große Modelle
SAGE: Ein realistischer Benchmark für das semantische Verständnis
WAVECLIP: Wellenleitertokenisierung für adaptiv-auflösendes CLIP
SLA: Über die Sparsität in Diffusions-Transformern hinaus durch feinabstimmbare sparse-lineare Aufmerksamkeit
SimpleFold: Die Faltung von Proteinen ist einfacher, als Sie denken
POINTS-Reader: Adaptierung von visuell-sprachlichen Modellen für die Dokumentenkonvertierung ohne Distillation
Allgemein gültige geometrische Synthese von Bildunterschriften
Vorteile und Fallen der Verstärkungslernens für die Planung von Sprachmodellen: Eine theoretische Perspektive
Schätzung der Befähigung von Sprachmodell-Agenten
Sprachmodelle können aus verbalen Rückmeldungen lernen, ohne skalarwertige Belohnungen zu erhalten
Variationales Schließen für Sprachmodelle
EPO: Entropieregelisierte Politikoptimierung für LLM-Agenten Verstärkendes Lernen
MinerU2.5: Ein entkoppeltes visuell-sprachliches Modell zur effizienten Verarbeitung hochauflösender Dokumente
Quantils-Vorteils-Schätzung für entropiesicheres Schließen
LongLive: Echtzeit-Interaktive Generierung langer Videos
Kombinatorische Kreativität: Eine neue Front in den Verallgemeinerungsfähigkeiten
Kausale räumlich-zeitliche Vorhersage: Ein effektiver und effizienter multimodaler Ansatz
Hunyuan3D-Omni: Ein einheitlicher Rahmen für die steuerbare Generierung von 3D-Ressourcen
Seedream 4.0: Bemühen um die nächste Generation der multimodalen Bildgenerierung
Baumsuche für die Verstärkungslernung von LLM-Agenten
SciReasoner: Legen der wissenschaftlichen Schlussfolgerungsgrundlage über Disziplinen hinweg
MMR1: Verbesserung multimodaler Schlussfolgerung durch varianzbehaftetes Sampling und offene Ressourcen
VCRL: varianzbasierendes Curriculum-Verstärkungslernen für große Sprachmodelle
MultiEdit: Fortschritte bei der anweisungsbezogenen Bildbearbeitung bei vielfältigen und anspruchsvollen Aufgaben
BRISC: Annotationierte Datensatz für die Segmentierung und Klassifizierung von Gehirntumoren mit Swin-HAFNet
EmoBench-M: Benchmarking der emotionalen Intelligenz für multimodale große Sprachmodelle
FDABench: Ein Benchmark für Daten-Agenten bei analytischen Abfragen über heterogene Daten
Einfacheres Malen als Denken: Können Text-zu-Bild-Modelle die Bühne bereiten, aber nicht das Spiel leiten?
UniVerse-1: Unified Audio-Video Generation durch Stitching von Experten
Wie gut sind Grundmodelle bei schrittweiser verkörperte Schlussfolgerung?
SpikingBrain-Technischer Bericht: Spiking Brain-inspirierte große Modelle
SAGE: Ein realistischer Benchmark für das semantische Verständnis
WAVECLIP: Wellenleitertokenisierung für adaptiv-auflösendes CLIP