Command Palette
Search for a command to run...
Papers
Täglich aktualisierte hochmoderne KI-Forschungsarbeiten, um Sie über die neuesten KI-Trends auf dem Laufenden zu halten

Von Pixeln zu Wörtern – Hin zu nativen visuellen Sprachprimitiven in Skalierung

Künstliche Intelligenz für Dienstleistungen: Proaktive Unterstützung mit KI-Brillen































Von Pixeln zu Wörtern – Hin zu nativen visuellen Sprachprimitiven in Skalierung

Künstliche Intelligenz für Dienstleistungen: Proaktive Unterstützung mit KI-Brillen






























WithAnyone: Hin zu kontrollierbarer und ID-konsistenter Bildgenerierung
Agenter Entropie-geglichener Politik-Optimierungsansatz
Wenn Modelle Lügen, lernen wir: Multisprachige Erkennung von Halluzinationen auf Satzebene mit PsiloQA
Vorhersage der sequenzspezifischen Amplifikationseffizienz bei Multi-Template-PCR mit Deep Learning
Das Genome Analysis Toolkit: Ein MapReduce-Framework zur Analyse von Next-Generation-DNA-Sequenzierungsdaten
LAMMPS – ein flexibles Simulationswerkzeug für die partikelbasierte Modellierung von Materialien auf atomarer, mesoskopischer und kontinuumsbasiertem Maßstab
LabOS: Der KI-XR-Mitforscher, der Menschen sieht und mit ihnen zusammenarbeitet
Dolphin: Dokumentenbildanalyse durch heterogene Anchor-Prompting
DeepMMSearch-R1: Multimodale LLMs in der multimodalen Web-Suche stärken
Skalierung großer Sprachmodelle für die nächste Generation der Einzelzellanalyse
Eine Übersicht über Vibe-Coding mit großen Sprachmodellen
Erkennen Sie alles über die Vorhersage des nächsten Punkts
Skalierung der sprachzentrierten omnimodalen Repräsentationslernen
DITING: Ein Multi-Agenten-Evaluierungsframework zur Benchmarking-Übersetzung von Web-Romanen
Voranschritt bei der end-to-end Pixelraum-generativen Modellierung durch selbstüberwachtes Vortrainieren
Räumliche Beeinflussung: Implizite Ausrichtung räumlicher Repräsentationen für visuelle-Sprache-Aktions-Modelle
Stellen von Klärungsfragen zur Präferenzerhebung mit großen Sprachmodellen
CTRL-Rec: Empfehlungssysteme mit natürlicher Sprache steuern
RLFR: Verlängerung des Verstärkungslernens für Sprachmodelle mit Flussumgebung
Latente Verbesserungsdekodierung: Verbesserung diffusionbasierter Sprachmodelle durch die Verfeinerung von Glaubenszuständen
OmniVideoBench: Eine Bewertung der audiovisuellen Verständnisfähigkeit für Omni-MLLMs
BEAR: Benchmarking und Verbesserung multimodaler Sprachmodelle für atomare verkörperte Fähigkeiten
Diffusions-Transformers mit Repräsentations-Autoencoder
QeRL: Über Effizienz hinaus – Quantisierungsverstärktes Verstärkungslernen für LLMs
Inversenfreie Wilson-Schleifen für Transformer: Ein praktischer Diagnoseansatz für Invarianz und Ordnungsempfindlichkeit
TUMIX: Multi-Agent Test-Time Scaling mit Werkzeugnutzungsmischung
R-Horizont: Wie weit kann Ihr großes Schlussfolgerungsmodell wirklich in Breite und Tiefe gehen?
AutoPR: Lassen Sie Ihre akademische Beförderung automatisieren!
Multimodale Prompt-Optimierung: Warum mehrere Modalitäten nicht für MLLMs genutzt werden sollten
TAG: Tangential Amplifying Guidance für hallucinationsresistente Diffusions-Sampling
WithAnyone: Hin zu kontrollierbarer und ID-konsistenter Bildgenerierung
Agenter Entropie-geglichener Politik-Optimierungsansatz
Wenn Modelle Lügen, lernen wir: Multisprachige Erkennung von Halluzinationen auf Satzebene mit PsiloQA
Vorhersage der sequenzspezifischen Amplifikationseffizienz bei Multi-Template-PCR mit Deep Learning
Das Genome Analysis Toolkit: Ein MapReduce-Framework zur Analyse von Next-Generation-DNA-Sequenzierungsdaten
LAMMPS – ein flexibles Simulationswerkzeug für die partikelbasierte Modellierung von Materialien auf atomarer, mesoskopischer und kontinuumsbasiertem Maßstab
LabOS: Der KI-XR-Mitforscher, der Menschen sieht und mit ihnen zusammenarbeitet
Dolphin: Dokumentenbildanalyse durch heterogene Anchor-Prompting
DeepMMSearch-R1: Multimodale LLMs in der multimodalen Web-Suche stärken
Skalierung großer Sprachmodelle für die nächste Generation der Einzelzellanalyse
Eine Übersicht über Vibe-Coding mit großen Sprachmodellen
Erkennen Sie alles über die Vorhersage des nächsten Punkts
Skalierung der sprachzentrierten omnimodalen Repräsentationslernen
DITING: Ein Multi-Agenten-Evaluierungsframework zur Benchmarking-Übersetzung von Web-Romanen
Voranschritt bei der end-to-end Pixelraum-generativen Modellierung durch selbstüberwachtes Vortrainieren
Räumliche Beeinflussung: Implizite Ausrichtung räumlicher Repräsentationen für visuelle-Sprache-Aktions-Modelle
Stellen von Klärungsfragen zur Präferenzerhebung mit großen Sprachmodellen
CTRL-Rec: Empfehlungssysteme mit natürlicher Sprache steuern
RLFR: Verlängerung des Verstärkungslernens für Sprachmodelle mit Flussumgebung
Latente Verbesserungsdekodierung: Verbesserung diffusionbasierter Sprachmodelle durch die Verfeinerung von Glaubenszuständen
OmniVideoBench: Eine Bewertung der audiovisuellen Verständnisfähigkeit für Omni-MLLMs
BEAR: Benchmarking und Verbesserung multimodaler Sprachmodelle für atomare verkörperte Fähigkeiten
Diffusions-Transformers mit Repräsentations-Autoencoder
QeRL: Über Effizienz hinaus – Quantisierungsverstärktes Verstärkungslernen für LLMs
Inversenfreie Wilson-Schleifen für Transformer: Ein praktischer Diagnoseansatz für Invarianz und Ordnungsempfindlichkeit
TUMIX: Multi-Agent Test-Time Scaling mit Werkzeugnutzungsmischung
R-Horizont: Wie weit kann Ihr großes Schlussfolgerungsmodell wirklich in Breite und Tiefe gehen?
AutoPR: Lassen Sie Ihre akademische Beförderung automatisieren!
Multimodale Prompt-Optimierung: Warum mehrere Modalitäten nicht für MLLMs genutzt werden sollten
TAG: Tangential Amplifying Guidance für hallucinationsresistente Diffusions-Sampling