Command Palette
Search for a command to run...
Papers
最新のAIトレンドを把握するための、日々更新される最先端AI研究論文
論文

ポリシーラグ下でのロールアウト再利用:LLM強化学習のためのプレフィックス正規化方策最適化

Harness-R1: エージェントの失敗軌跡からの実行可能ランタイムハーネス編集の学習






























FinanceHarness: 自律的金融ディープリサーチフレームワーク
DeepSeek-V4: 高効率な100万トークン文脈知能を目指して
知識と幾何の分離:ストリーミング推薦のための更新可能な事前学習済み転移
Video-DeepResearch: 次世代マルチモーダル深層リサーチエージェントを目指して
AURORA-LM: 連続潜在拡散言語モデルのための自己符号化統合表現
Hunyuan3D-Buffalo 1.0: スケーラブルな3D生成、理解、編集のための統合マルチモーダルモデル
JoyAI-Video-Edit: 自己回帰拡散モデルによるリアルタイム自由形式動画編集
MerchantBench: Eコマース業務におけるLLMエージェントの長期的首尾一貫性評価ベンチマーク
nGPTの訓練
UEmbed: 統一されたスパース・密マルチモーダル埋め込み
VAD: マルチモーダル方策内蒸留におけるターゲット再構成のための視覚的証拠の帰属
強化学習による漸進的エージェントスキル生成
DAPD: 双方向アンカー付きポリシー蒸留
LongHorizon-Harness: 実世界タスクに向けた長期的エージェントの高度化
SwanTale: 指示タスクとゼロショットタスクのための統一型マルチ話者音声・オーディオ生成
Fara-1.5: コンピュータ操作エージェントのためのスケーラブルな学習環境
Docling 技術報告書
ハイスループット評価から湿式実験へ:検索拡張モデルによる変異効果予測の進展
モデルかハーネスか?エージェント障害を特定するための相互作用中心の分類体系
言語モデルに自らの意識を主張させる誘導が人間の信念と価値観を回復させる
Diamond: ニューラルオーディオコーデックトークン上の自己回帰型RQ-Transformerによる音声復元のための系列変換モデル
N0-TWAM: 接触リッチ操作のための触覚ネイティブ世界行動モデルのスケーリング
AISPA:大規模言語モデルアプリケーションのためのユーザ中心型システムプロンプト監査
メンタルワールドモデリング
Meshy T2: フローマッチングによる高速ネイティブメッシュ生成
N0-VTLA: 潜在触覚トークンによる視覚–触覚–言語–行動モデルのスケーリング
RLVRからRLSVRへ:タスク変換がもたらす自己検証可能報酬によるオープンエンドなLLM自己改善
BEACON: エージェント型視覚推論をいつどのように実行すべきかを知る
SkillSmith: パラメトリックスキルとテキスト知識の構成学習
VideoCoCo: エージェント型デュアルエンジンシステムによる物理的に一貫性のある動画生成のための思考連鎖としてのコード