Command Palette
Search for a command to run...
Papers
Täglich aktualisierte hochmoderne KI-Forschungsarbeiten, um Sie über die neuesten KI-Trends auf dem Laufenden zu halten

DreamStyle: Ein einheitlicher Rahmen für die Video-Stilisierung

UniCorn: Hin zum selbstverbessernden, einheitlichen multimodalen Modellen durch selbstgenerierte Supervision































DreamStyle: Ein einheitlicher Rahmen für die Video-Stilisierung

UniCorn: Hin zum selbstverbessernden, einheitlichen multimodalen Modellen durch selbstgenerierte Supervision






























LTX-2: Effizientes gemeinsames Audio-Visual-Grundmodell
SciEvalKit: Ein Open-Source-Evaluierungstoolkit für wissenschaftliche allgemeine Intelligenz
MOSS Transkribieren Diarisieren: Genauere Transkription mit Sprecherdiarisierung
InfiniDepth: Beliebig hohe Auflösung und fein granulierte Tiefenschätzung mit neuronalen impliziten Feldern
Anpassung von agentenbasiertem KI
Großer Video-Planer ermöglicht verallgemeinerbare Robotersteuerung
InfiniteVGGT: Visual Geometry Grounded Transformer für endlose Datenströme
GARDO: Verbesserung von Diffusionsmodellen ohne Reward Hacking
VAR RL richtig gemacht: Umgang mit asynchronen Polizkonflikten in visuellen autoregressiven Generierungen
DreamID-V: Brückenbildung zwischen Bild- und Videobereich für hochauflösende Gesichtsaustauschverfahren mittels Diffusion Transformer
NextFlow: Unified Sequential Modeling aktiviert multimodales Verständnis und Generierung
K-EXAONE Technischer Bericht
Der Hunger-Spiel-Debatte: Zur Entstehung von Über-Konkurrenz in Multi-Agenten-Systemen
Training von KI-Ko-Wissenschaftlern mit Hilfe von Bewertungsrasterbelohnungen
AdaGaR: Adaptive Gabor Representation for Dynamic Scene Reconstruction
Zähmung von Halluzinationen: Steigerung des Videoverstehens durch Gegenfaktische Videoerzeugung
SenseNova-MARS: Stärkung multimodaler agenter Schlussfolgerung und Suche durch Verstärkungslernen
Avatar Forcing: Echtzeit-Interaktive Kopf-Avatar-Erzeugung für natürliche Gespräche
NeoVerse: Verbesserung des 4D-Weltmodells mit in-the-wild monokularen Videos
Youtu-Agent: Skalierung der Agentenproduktivität durch automatisierte Generierung und hybride Politikoptimierung
IQuest-Coder-V1 Technischer Bericht
Rekursive Sprachmodelle
FlowBlending: stufenbewusste Mehrmodell-Sampling für schnelle und hochfidele Videogenerierung
Dream2Flow: Verbindung von Video-Generierung und Open-World-Manipulation mittels 3D-Objekt-Flow
Zur Rolle der Diskretisierung in Diffusion LLMs
DiffThinker: Hin zu generativer multimodaler Reasoning mit Diffusionsmodellen
Dynamische große Konzeptmodelle: Latente Reasoning in einem adaptiven semantischen Raum
Verbesserung von Multi-step RAG mit hypergraphbasierter Memory für langkontextuelle komplexe relationale Modellierung
Künstliche Intelligenz trifft auf das Gehirn: Speichersysteme von der kognitiven Neurowissenschaft bis zu autonomen Agenten
Skalierung offener Schlussfolgerungen zur Vorhersage der Zukunft
LTX-2: Effizientes gemeinsames Audio-Visual-Grundmodell
SciEvalKit: Ein Open-Source-Evaluierungstoolkit für wissenschaftliche allgemeine Intelligenz
MOSS Transkribieren Diarisieren: Genauere Transkription mit Sprecherdiarisierung
InfiniDepth: Beliebig hohe Auflösung und fein granulierte Tiefenschätzung mit neuronalen impliziten Feldern
Anpassung von agentenbasiertem KI
Großer Video-Planer ermöglicht verallgemeinerbare Robotersteuerung
InfiniteVGGT: Visual Geometry Grounded Transformer für endlose Datenströme
GARDO: Verbesserung von Diffusionsmodellen ohne Reward Hacking
VAR RL richtig gemacht: Umgang mit asynchronen Polizkonflikten in visuellen autoregressiven Generierungen
DreamID-V: Brückenbildung zwischen Bild- und Videobereich für hochauflösende Gesichtsaustauschverfahren mittels Diffusion Transformer
NextFlow: Unified Sequential Modeling aktiviert multimodales Verständnis und Generierung
K-EXAONE Technischer Bericht
Der Hunger-Spiel-Debatte: Zur Entstehung von Über-Konkurrenz in Multi-Agenten-Systemen
Training von KI-Ko-Wissenschaftlern mit Hilfe von Bewertungsrasterbelohnungen
AdaGaR: Adaptive Gabor Representation for Dynamic Scene Reconstruction
Zähmung von Halluzinationen: Steigerung des Videoverstehens durch Gegenfaktische Videoerzeugung
SenseNova-MARS: Stärkung multimodaler agenter Schlussfolgerung und Suche durch Verstärkungslernen
Avatar Forcing: Echtzeit-Interaktive Kopf-Avatar-Erzeugung für natürliche Gespräche
NeoVerse: Verbesserung des 4D-Weltmodells mit in-the-wild monokularen Videos
Youtu-Agent: Skalierung der Agentenproduktivität durch automatisierte Generierung und hybride Politikoptimierung
IQuest-Coder-V1 Technischer Bericht
Rekursive Sprachmodelle
FlowBlending: stufenbewusste Mehrmodell-Sampling für schnelle und hochfidele Videogenerierung
Dream2Flow: Verbindung von Video-Generierung und Open-World-Manipulation mittels 3D-Objekt-Flow
Zur Rolle der Diskretisierung in Diffusion LLMs
DiffThinker: Hin zu generativer multimodaler Reasoning mit Diffusionsmodellen
Dynamische große Konzeptmodelle: Latente Reasoning in einem adaptiven semantischen Raum
Verbesserung von Multi-step RAG mit hypergraphbasierter Memory für langkontextuelle komplexe relationale Modellierung
Künstliche Intelligenz trifft auf das Gehirn: Speichersysteme von der kognitiven Neurowissenschaft bis zu autonomen Agenten
Skalierung offener Schlussfolgerungen zur Vorhersage der Zukunft