Command Palette
Search for a command to run...
Papers
Täglich aktualisierte hochmoderne KI-Forschungsarbeiten, um Sie über die neuesten KI-Trends auf dem Laufenden zu halten

SPAN: Raumliche Projektionsausrichtung für die monokulare 3D-Objekterkennung

Effiziente Approximation von Volterra-Reihen für hochdimensionale Systeme































SPAN: Raumliche Projektionsausrichtung für die monokulare 3D-Objekterkennung

Effiziente Approximation von Volterra-Reihen für hochdimensionale Systeme






























SofT-GRPO: Überwindung der diskreten Token-basierten Verstärkungslernens von Sprachmodellen durch eine Gumbel-reparameterisierte Soft-Thinking-Policy-Optimierung
RedOne 2.0: Neubewertung der domain-spezifischen Nachschulung von LLMs in sozialen Netzwerken
Die Station: Eine offene Weltumgebung für künstliche Intelligenz-getriebene Entdeckungen
DRIVE: Best Practices für die Datenaufbereitung bei der Verstärkungslernverfahren mit überprüfbarer Belohnung in der wettbewerbsorientierten Codeerzeugung
IterResearch: Neubewertung von Langfrist-Agenten durch markovsche Zustandsrekonstruktion
HaluMem: Evaluierung von Halluzinationen in Speichersystemen von Agenten
GVPO: Gruppensvarianz-Richtlinien-Optimierung für die Nachschulung großer Sprachmodelle
ReCA: Integrierte Beschleunigung für Echtzeit- und effiziente kooperative körperhafte autonome Agenten
DexFlyWheel: Ein skalierbarer und selbstverbessernder Rahmen zur Datenerzeugung für geschickte Manipulation
NovaFlow: Null-Shot-Manipulation mittels handlungsfähiger Flüsse aus generierten Videos
TreeSynth: Synthetische Erzeugung vielfältiger Daten von Grund auf durch baumgeleitete Unterraumpartitionierung
GTA: Überwachter, geführter Reinforcement-Learning für die Textklassifikation mit großen Sprachmodellen
Modellierung von konformationsensembles von Proteinen und kleinen Molekülen mit PLACER
Agentenspezifische Kontextgestaltung: Evolvierte Kontexte für selbstverbessernde Sprachmodelle
DiaMoE-TTS: Ein einheitlicher, auf IPA basierender Dialekt-TTS-Framework mit Mixture-of-Experts und parameter-effizienter Zero-Shot-Anpassung
KI-gestützte AR-Montage: Objekterkennung und Computer Vision für die augmentierte Realität-gestützte Montage
Jailbreaking im Heuhaufen
CritiCal: Kann Kritik die Unsicherheits- oder Zuverlässigkeitskalibrierung von LLMs unterstützen?
Zur Minderung von Halluzinationen in großen Vision-Sprach-Modellen durch die Verfeinerung von textuellen Embeddings
Visuelle räumliche Abstimmung
Zu gut, um schlecht zu sein: Über den Misserfolg von LLMs beim Rollenspiel von Bösewichten
DeepEyesV2: Ein Schritt hin zu einem agierenden multimodalen Modell
Einsatz von kontinuierlicher Glukoseüberwachung mit maschinellem Lernen zur Identifizierung metabolischer Subphänotypen und zur Informationsgewinnung für präzise Lebensstiländerungen
Die Wiederverwendung von Vortrainingsdaten zur Testzeit wirkt sich wie ein Rechenverstärker aus
NVIDIA Nemotron Nano V2 VL
CostBench: Bewertung von Multi-Turn-Kosten-optimalem Planen und Anpassen in dynamischen Umgebungen für LLM-Tool-Verwendungs-Agenten
Cambrian-S: Hin zu einer räumlichen Supersensierung in Videos
Skalierung des Lernens von Agenten durch Erfahrungssynthese
V-Thinker: Interaktives Denken mit Bildern
Mit Video denken: Videoerzeugung als vielversprechendes multimodales Schlussfolgerungsparadigma
SofT-GRPO: Überwindung der diskreten Token-basierten Verstärkungslernens von Sprachmodellen durch eine Gumbel-reparameterisierte Soft-Thinking-Policy-Optimierung
RedOne 2.0: Neubewertung der domain-spezifischen Nachschulung von LLMs in sozialen Netzwerken
Die Station: Eine offene Weltumgebung für künstliche Intelligenz-getriebene Entdeckungen
DRIVE: Best Practices für die Datenaufbereitung bei der Verstärkungslernverfahren mit überprüfbarer Belohnung in der wettbewerbsorientierten Codeerzeugung
IterResearch: Neubewertung von Langfrist-Agenten durch markovsche Zustandsrekonstruktion
HaluMem: Evaluierung von Halluzinationen in Speichersystemen von Agenten
GVPO: Gruppensvarianz-Richtlinien-Optimierung für die Nachschulung großer Sprachmodelle
ReCA: Integrierte Beschleunigung für Echtzeit- und effiziente kooperative körperhafte autonome Agenten
DexFlyWheel: Ein skalierbarer und selbstverbessernder Rahmen zur Datenerzeugung für geschickte Manipulation
NovaFlow: Null-Shot-Manipulation mittels handlungsfähiger Flüsse aus generierten Videos
TreeSynth: Synthetische Erzeugung vielfältiger Daten von Grund auf durch baumgeleitete Unterraumpartitionierung
GTA: Überwachter, geführter Reinforcement-Learning für die Textklassifikation mit großen Sprachmodellen
Modellierung von konformationsensembles von Proteinen und kleinen Molekülen mit PLACER
Agentenspezifische Kontextgestaltung: Evolvierte Kontexte für selbstverbessernde Sprachmodelle
DiaMoE-TTS: Ein einheitlicher, auf IPA basierender Dialekt-TTS-Framework mit Mixture-of-Experts und parameter-effizienter Zero-Shot-Anpassung
KI-gestützte AR-Montage: Objekterkennung und Computer Vision für die augmentierte Realität-gestützte Montage
Jailbreaking im Heuhaufen
CritiCal: Kann Kritik die Unsicherheits- oder Zuverlässigkeitskalibrierung von LLMs unterstützen?
Zur Minderung von Halluzinationen in großen Vision-Sprach-Modellen durch die Verfeinerung von textuellen Embeddings
Visuelle räumliche Abstimmung
Zu gut, um schlecht zu sein: Über den Misserfolg von LLMs beim Rollenspiel von Bösewichten
DeepEyesV2: Ein Schritt hin zu einem agierenden multimodalen Modell
Einsatz von kontinuierlicher Glukoseüberwachung mit maschinellem Lernen zur Identifizierung metabolischer Subphänotypen und zur Informationsgewinnung für präzise Lebensstiländerungen
Die Wiederverwendung von Vortrainingsdaten zur Testzeit wirkt sich wie ein Rechenverstärker aus
NVIDIA Nemotron Nano V2 VL
CostBench: Bewertung von Multi-Turn-Kosten-optimalem Planen und Anpassen in dynamischen Umgebungen für LLM-Tool-Verwendungs-Agenten
Cambrian-S: Hin zu einer räumlichen Supersensierung in Videos
Skalierung des Lernens von Agenten durch Erfahrungssynthese
V-Thinker: Interaktives Denken mit Bildern
Mit Video denken: Videoerzeugung als vielversprechendes multimodales Schlussfolgerungsparadigma