Command Palette
Search for a command to run...
Papers
最新のAIトレンドを把握するための、日々更新される最先端AI研究論文
論文

連続的な事前学習中に大規模言語モデルはどのように概念を学習するか?

JudgeRLVR:効率的な推論のための最初に判断し、次に生成するアプローチ






























SnapGen++:エッジデバイスにおける効率的で高忠実度の画像生成のためのDiffusion Transformersの活用
動画生成におけるモーションアトリビューション
VLingNav: 適応的推論と視覚補助的Linguistic Memoryを用いたEmbodied Navigation
ミニストラル3
信頼度の二律背反:ツール利用エージェントにおける誤補正の分析と軽減
ShowUI-π:GUIに適したドexterousなハンドを備えたフローベースの生成モデル
野生における潜在行動世界モデルの学習
ドクター・ゼロ:学習データを必要としない自己進化型検索エージェント
MHLA:トークンレベル多頭による線形アテンションの表現力の回復
GlimpRouter:思考の一トークンを覗くことで実現する効率的な協調推論
X-Coder:完全に合成されたタスク、ソリューション、テストによる競技プログラミングの進展
PaCoRe:並列協調推論を用いたテスト時計算資源のスケーラビリティ学習
BabyVision:言語を越える視覚的推論
視聴、推論、探索:エージェント型動画推論のためのオープンWeb上での動画ディープリサーチベンチマーク
スケーラブルなルックアップを用いた条件付きメモリ:大規模言語モデルにおけるスパース性の新たな軸
EnvScaler:プログラム合成によるLLMエージェント向けツール対話型環境のスケーリング
証拠のチェーン化:引用を意識したルーブリック報酬を用いた深層検索エージェントに対するロバストな強化学習
カリカチャGS:ガウス曲率を用いた3Dガウススプラッティング顔の誇張
思考の分子構造:長距離チェーン・オブ・シンキングのトポロジーをマッピングする
MMFormalizer:ワイルドな状況におけるマルチモーダル自動形式化
マップを用いた思考:強化型並列マップ拡張エージェントによる地理局所化
順序付けの障壁を打ち破った指向性単一始点最短経路問題
GR-Dexter 技術報告
VideoAuto-R1:一度の思考で済ませ、二度の回答を行うことで実現する動画自動推論
RelayLLM:協調デコードによる効率的な推論
トークンレベルにおけるLLM協働のためのFusionRoute
RL-AWB:低照度夜間シーンにおける自動ホワイトバランス補正のためのディープ強化学習
学習可能なマルチプライヤー:言語モデル行列層のスケーリングを解放する
GDPO:マルチリワードRL最適化のためのグループ報酬分解型正規化ポリシー最適化
MemRL:エピソード記憶上のランタイム強化学習を用いた自己進化型エージェント