Command Palette
Search for a command to run...
Papers
Täglich aktualisierte hochmoderne KI-Forschungsarbeiten, um Sie über die neuesten KI-Trends auf dem Laufenden zu halten
Papers

VLA-RFT: Vision-Sprache-Aktion-Verstärkungsfine-Tuning mit überprüften Belohnungen in Weltsimulatoren

DeepSearch: Die Beschränkung des Verstärkungslernens durch überprüfbare Belohnungen über Monte-Carlo-Baum-Suche überwinden






























OceanGym: Eine Benchmark-Umgebung für unterwasserembodierte Agenten
TruthRL: Anreizschaffung für ehrliche LLMs mittels Verstärkungslernen
Gewinnen des Beschneidungsspiels: Ein einheitlicher Ansatz für die gemeinsame Proben- und Token-Beschneidung zur effizienten überwachten Feinabstimmung
Das Drachenjunges: Die fehlende Verbindung zwischen dem Transformer und Modellen des Gehirns
Vision-Zero: Skalierbare Selbstverbesserung von VLMs durch strategisches, gamifiziertes Selbstspielen
MCPMark: Ein Benchmark zur Belastungstestung realistischer und umfassender MCP-Nutzung
Zufällige Politikbewertung reicht aus für LLM-Reasoning mit überprüfbaren Belohnungen
Die Demokratisierung von KI-Wissenschaftlern mithilfe von ToolUniverse
Wann ist Schlussfolgern wichtig? Eine kontrollierte Studie zum Beitrag des Schlussfolgerns für die Modellleistung
Multiplayer-Nash-Präferenz-Optimierung
StableToken: Ein geräuschrobuster semantischer Sprachtokenisierer für resiliente Sprach-LLMs
SLA: Über die Sparsität in Diffusions-Transformern hinaus durch feinabstimmbare sparse-lineare Aufmerksamkeit
SimpleFold: Die Faltung von Proteinen ist einfacher, als Sie denken
POINTS-Reader: Adaptierung von visuell-sprachlichen Modellen für die Dokumentenkonvertierung ohne Distillation
Allgemein gültige geometrische Synthese von Bildunterschriften
Vorteile und Fallen der Verstärkungslernens für die Planung von Sprachmodellen: Eine theoretische Perspektive
Schätzung der Befähigung von Sprachmodell-Agenten
Sprachmodelle können aus verbalen Rückmeldungen lernen, ohne skalarwertige Belohnungen zu erhalten
Variationales Schließen für Sprachmodelle
EPO: Entropieregelisierte Politikoptimierung für LLM-Agenten Verstärkendes Lernen
MinerU2.5: Ein entkoppeltes visuell-sprachliches Modell zur effizienten Verarbeitung hochauflösender Dokumente
Quantils-Vorteils-Schätzung für entropiesicheres Schließen
LongLive: Echtzeit-Interaktive Generierung langer Videos
Kombinatorische Kreativität: Eine neue Front in den Verallgemeinerungsfähigkeiten
Kausale räumlich-zeitliche Vorhersage: Ein effektiver und effizienter multimodaler Ansatz
Hunyuan3D-Omni: Ein einheitlicher Rahmen für die steuerbare Generierung von 3D-Ressourcen
Seedream 4.0: Bemühen um die nächste Generation der multimodalen Bildgenerierung
Baumsuche für die Verstärkungslernung von LLM-Agenten
SciReasoner: Legen der wissenschaftlichen Schlussfolgerungsgrundlage über Disziplinen hinweg
MMR1: Verbesserung multimodaler Schlussfolgerung durch varianzbehaftetes Sampling und offene Ressourcen