Command Palette
Search for a command to run...
Papers
Täglich aktualisierte hochmoderne KI-Forschungsarbeiten, um Sie über die neuesten KI-Trends auf dem Laufenden zu halten

Glia: Ein menschenähnliches KI-System für die automatisierte Systemgestaltung und -optimierung

Context Engineering 2.0: Der Kontext des Context Engineering































Glia: Ein menschenähnliches KI-System für die automatisierte Systemgestaltung und -optimierung

Context Engineering 2.0: Der Kontext des Context Engineering






























Spatial-SSRL: Verbesserung des räumlichen Verständnisses durch selbstüberwachtes Verstärkungslernen
Kontinuierliche autoregressive Sprachmodelle
πextttRL: Online-RL-Finetuning für flussbasierte visuelle Sprach-Aktions-Modelle
INT gegenüber FP: Eine umfassende Studie zu feinkörnigen Low-Bit-Quantisierungsformaten
ThinkMorph: Emergente Eigenschaften bei multimodaler abwechselnder Denkketten-Reasoning
OS-Sentinel: Ein Weg zu sicherheitsverbesserten mobilen GUI-Agenten durch hybride Validierung in realistischen Workflows
Das Zeitalter der agierenden Organisation: Organisieren mit Sprachmodellen lernen
SPICE: Selbstspiel in Korpusumgebungen verbessert das Schlussfolgern
Surfer 2: Die nächste Generation der plattformübergreifenden Computeranwender-Agenten
Untersuchung der Bedingungen für Diffusionsmodelle in der roboterbasierten Steuerung
Kann ein Agent das Web beherrschen? Erkundung der Grenzen des ChatGPT Atlas Agents in Web-Spielen
Kimi Linear: Eine ausdrucksstarke und effiziente Aufmerksamkeitsarchitektur
Emu3.5: Native Multimodale Modelle sind Welten-Lerner
Das Ende der manuellen Decodierung: Hin zu wirklich end-to-end-Sprachmodellen
Mensch-AI-Komplementarität: Ein Ziel für verstärkte Aufsicht
GPTOpt: Hin zu einer effizienten, auf LLMs basierenden schwarzen Kasten-Optimierung
VFXMaster: Freigabe der dynamischen Generierung von visuellen Effekten durch Lernen im Kontext
Prozessmining-basiertes reasoning-orientiertes GRPO
Skalierung latenter Schlussfolgerung mittels geschlossener Sprachmodelle
ReForm: Reflektive Autoformalisierung mit prospektiver begrenzter Sequenzoptimierung
Video-Thinker: Auslösen von „Denken mit Videos“ mittels Verstärkungslernen
JanusCoder: Ein Schritt hin zu einer grundlegenden visuell-programmatischen Schnittstelle für Code-Intelligenz
MCP-Flow: Unterstützung von LLM-Agenten beim Meistern realweltbezogener, vielfältiger und skalierbarer MCP-Tools
OmniCast: Ein maskierter latenter Diffusionsmodell für Wettervorhersagen über verschiedene Zeitskalen
Gleichmäßige diskrete Diffusion mit metrischem Pfad für die Videogenerierung
Game-TARS: Vortrainierte Grundmodell für skalierbare, allgemeine multimodale Spielagenten
RoboOmni: Proaktive Roboter-Manipulation im Omni-modalen Kontext
AgentFold: Langfristige Web-Agenten mit proaktiver Kontextverwaltung
Technischer Bericht zu Tongyi DeepResearch
InteractComp: Bewertung von Suchagenten mit mehrdeutigen Anfragen
Spatial-SSRL: Verbesserung des räumlichen Verständnisses durch selbstüberwachtes Verstärkungslernen
Kontinuierliche autoregressive Sprachmodelle
πextttRL: Online-RL-Finetuning für flussbasierte visuelle Sprach-Aktions-Modelle
INT gegenüber FP: Eine umfassende Studie zu feinkörnigen Low-Bit-Quantisierungsformaten
ThinkMorph: Emergente Eigenschaften bei multimodaler abwechselnder Denkketten-Reasoning
OS-Sentinel: Ein Weg zu sicherheitsverbesserten mobilen GUI-Agenten durch hybride Validierung in realistischen Workflows
Das Zeitalter der agierenden Organisation: Organisieren mit Sprachmodellen lernen
SPICE: Selbstspiel in Korpusumgebungen verbessert das Schlussfolgern
Surfer 2: Die nächste Generation der plattformübergreifenden Computeranwender-Agenten
Untersuchung der Bedingungen für Diffusionsmodelle in der roboterbasierten Steuerung
Kann ein Agent das Web beherrschen? Erkundung der Grenzen des ChatGPT Atlas Agents in Web-Spielen
Kimi Linear: Eine ausdrucksstarke und effiziente Aufmerksamkeitsarchitektur
Emu3.5: Native Multimodale Modelle sind Welten-Lerner
Das Ende der manuellen Decodierung: Hin zu wirklich end-to-end-Sprachmodellen
Mensch-AI-Komplementarität: Ein Ziel für verstärkte Aufsicht
GPTOpt: Hin zu einer effizienten, auf LLMs basierenden schwarzen Kasten-Optimierung
VFXMaster: Freigabe der dynamischen Generierung von visuellen Effekten durch Lernen im Kontext
Prozessmining-basiertes reasoning-orientiertes GRPO
Skalierung latenter Schlussfolgerung mittels geschlossener Sprachmodelle
ReForm: Reflektive Autoformalisierung mit prospektiver begrenzter Sequenzoptimierung
Video-Thinker: Auslösen von „Denken mit Videos“ mittels Verstärkungslernen
JanusCoder: Ein Schritt hin zu einer grundlegenden visuell-programmatischen Schnittstelle für Code-Intelligenz
MCP-Flow: Unterstützung von LLM-Agenten beim Meistern realweltbezogener, vielfältiger und skalierbarer MCP-Tools
OmniCast: Ein maskierter latenter Diffusionsmodell für Wettervorhersagen über verschiedene Zeitskalen
Gleichmäßige diskrete Diffusion mit metrischem Pfad für die Videogenerierung
Game-TARS: Vortrainierte Grundmodell für skalierbare, allgemeine multimodale Spielagenten
RoboOmni: Proaktive Roboter-Manipulation im Omni-modalen Kontext
AgentFold: Langfristige Web-Agenten mit proaktiver Kontextverwaltung
Technischer Bericht zu Tongyi DeepResearch
InteractComp: Bewertung von Suchagenten mit mehrdeutigen Anfragen