Command Palette
Search for a command to run...
15億個のパラメータを持つMiniCPM-RobotManipが正式にオープンソース化されました。NVIDIAは、テキスト、画像、動画、モーションシーケンスを網羅するフルモーダルモデルであるCosmos3-Edgeをリリースしました。

身体化された知能の分野において、ロボットが知覚、理解、行動できるようにすることは、インテリジェントエージェントを現実世界に展開する上で鍵となります。MiniCPMのMiniCPM-Robotシリーズは、ロボット操作とターゲット追跡という2つの主要なタスクを探求します。MiniCPM-RobotManipは、わずか15億個のパラメータを持つ視覚言語アクションモデルです。MiniCPM-V 4.6の視覚言語バックボーンをベースに、拡散型アクションヘッドを組み合わせることで、視覚的な観察と言語コマンドからロボットの動作まで、エンドツーエンドのマッピングを実現します。MiniCPM-RobotTrackは、実体ターゲット追跡に特化し、0.9Bパラメータでリアルタイムのエッジ視覚追跡機能を実現します。軽量アーキテクチャ、ストリーミングコンテキストメモリ、効率的な視覚圧縮技術により、MiniCPM-Robotシリーズは、小型モデルを用いた実世界のロボットシナリオにおける効率的な推論の可能性を示しています。
HyperAIのウェブサイトに「MiniCPM-Robot:現実世界のための具現化された知能モデル」が掲載されましたので、ぜひお試しください!
オンラインでの使用:https://go.hyper.ai/0VsYI
hyper.aiの公式サイトにおける7月25日から7月30日までの更新内容の概要は以下のとおりです。
* 高品質な公開データセット:9件
*厳選された高品質なチュートリアル: 8
* コミュニティ記事分析:2件
* 人気のある百科事典のエントリ: 5
公式ウェブサイトにアクセスしてください:ハイパーアイ
公開データセットの選択
1.数学グラフ 数学定理 依存関係グラフデータセット
Math-Graphは、ワシントン大学数理人工知能研究所が2026年に公開した、数学定理の依存関係グラフのデータセットです。これは、定理のステートメントレベルでの依存関係グラフを構築します。関連論文のタイトルは「TheoremGraph: Bridging Formal and Informal Mathematics」です。
このデータセットには、非公式な数学的記述と公式な数学的記述のペアが47,952組含まれており、非公式な数学と公式な数学の両方を網羅する一貫性のある依存関係グラフに、2種類の数学的知識が統合されています。これには、論文のメタデータ、数学的記述(公式/非公式)、依存関係のエッジ、およびLLMによって生成された自然言語による説明が含まれます。
オンラインで実行:https://go.hyper.ai/bwVQf
2.Nemotron-SFT-Math-v4 数学的推論SFTデータセット
Nemotron-SFT-Math-v4は、NVIDIAが2026年5月に公開した数学的推論データセットです。関連論文のタイトルは「Nemotron-Math: Efficient Long-Context Distillation of Mathematical Reasoning from Multi-Mode Supervision」です。このデータセットは、従来の数学データセットにおける品質のばらつき、非標準的な推論軌跡、低い精度、限られたシナリオといった問題を解決することを目的としています。モデルの構造化推論、マルチ軌跡推論、および解答検証機能を効果的に向上させます。大規模な数学的推論モデルの微調整、推論軌跡分析、解答検証アルゴリズムの開発、ロングコンテキスト推論システムの構築、およびモデル推論の堅牢性評価に幅広く利用されています。
このデータセットには、545,431個のトレーニングサンプルが含まれており、その内訳はCOT推論サンプル285,516個とTIRツール推論サンプル259,915個です。競技会や大学における代数、幾何学、数論、組み合わせ論などの数学的シナリオを網羅しています。データは、手動と自動を組み合わせたハイブリッド方式で注釈付けされており、固有番号、質問文、複数ターン対話、標準回答、ソース、プロトコルなどの標準化されたフィールドが含まれています。
オンラインで実行:https://go.hyper.ai/Kv9E4
3.MathNetマルチモーダル数学ベンチマーク推論データセット
MathNetは、MITの研究チームがキング・アブドラ科学技術大学をはじめとする複数の機関と共同で2026年に公開した、大規模かつ多言語・マルチモーダルな数学的推論データセットです。関連論文のタイトルは「MathNet:数学的推論と検索のためのグローバルなマルチモーダルベンチマーク」です。この手法は、オリンピックレベルの数学的推論および構造化検索タスクにおける大規模モデルの能力を評価および向上させることを目的としており、数学的推論評価、RAG研究、およびマルチモーダルAIトレーニングで広く使用されています。
このデータセット(バージョンv0)には、27,817問のエキスパートレベルの数学問題とその標準解答が収録されています。58の国と地域から17言語で出題された公式数学コンテストの問題を網羅しており、5,148問の図解付き問題と、合計7,541点の幾何学的およびグラフによる図解が含まれています。このデータセットは、代数、幾何学、数論、組み合わせ論、微積分、確率と統計、およびその他のオリンピック数学知識体系をカバーしています。数学問題の解決、数学的意味検索(構造的に同等で類似した問題の特定)、および検索強化問題解決という3つのベンチマークタスクをサポートします。
オンラインで実行:https://go.hyper.ai/AWKaV

4Nemotron-Math-v2 数学的推論データセット
Nemotron-Math-v2は、NVIDIA Corporationが2025年に公開した数学的推論データセットです。関連研究は「Nemotron-Math:マルチモード監視による数学的推論の効率的な長コンテキスト蒸留」と題されています。これは主に、構造化された数学的推論を実行するLLMのトレーニング、ツール強化推論と純粋言語推論の違いの研究、および長コンテキストまたはマルチパス推論システムの構築に使用されます。
このデータセットには、約347,000件の高品質な数学問題と、モデルによって生成された700万件の推論軌跡が含まれています。各問題は、推論深度が高/中/低、Python TIRの有無の6つの構成で解かれ、LLMをアービターとして用いたパイプラインによって検証されます。
オンラインで実行:https://go.hyper.ai/rYdfW
5. CHIMERA汎用推論合成データセット
CHIMERAは、推論トレーニング専用に設計された合成推論データセットです。関連論文のタイトルは「CHIMERA:汎用的なLLM推論のためのコンパクトな合成データ」です。
このデータセットは、STEM分野の幅広い領域を網羅し、ロングチェーン思考(CoT)の軌跡を提供します。数学、コンピュータサイエンス、化学、物理学、文学、歴史、生物学、音声学の8つの分野にわたる9,225の質問が含まれています。すべての例は大規模言語モデル(LLM)によって生成され、手動による注釈なしに自動的に検証されます。
オンラインで実行:https://go.hyper.ai/JskxG
6. Open-RL推論問題データセット
Open-RLは、Turingが2026年に公開した、複数の領域にわたる推論問題データセットです。物理学、数学、生物学、化学における、独立した、検証可能な、明確なSTEM推論問題が含まれています。各問題は複数段階の推論を必要とし、記号演算や数値計算を伴い、客観的に検証可能な最終解答を持ちます。
このデータセットは、強化学習の微調整、報酬モデリング、結果に基づく教師あり学習、および検証可能な推論ベンチマークに適しています。それぞれの問題は、複数の推論段階を必要とし、記号演算と数値計算を伴い、検証可能な最終解答が得られる。
オンラインで実行:https://go.hyper.ai/WYDck
7. GPT-5.4 ステップワイズ推論データセット
GPT-5.4ステップバイステップ推論データセットは、長連鎖推論(CoT)モデリングと複雑な問題解決タスク向けに設計された高密度合成推論データセットです。このデータセットは「マスターアーキテクト」ワークフローに基づいて構築されており、gemini 3フラッシュを使用して難易度の高いヒントを生成し、これをGPT-5.4推論コアと組み合わせることで、複数ステップの推論と結果生成を完了させます。
このデータセットには、数学、プログラミング、医学といった高度に複雑な分野を網羅した、約1,500件のエリートレベルのサンプルが含まれています。課題の難易度は、「グランドマスター」レベルと「博士号取得者」レベルに統一されています。データサンプルには、完全な多段階推論プロセスと検証済みの最終解答が含まれているため、長鎖論理導出や高度な推論能力の評価を伴うシナリオに適しています。
オンラインで実行:https://go.hyper.ai/CeBEp
8.Sutra 10B 事前学習用教育・訓練データセット
Sutra 10B Pretrainingは、大規模言語モデルの事前学習のための高品質な教育用データセットです。Sutraフレームワークによって生成され、構造化された教育コンテンツを作成し、言語モデルの事前学習を最適化します。これはSutraシリーズの中で最大のデータセットであり、高密度で適切にキュレーションされたデータセットが、小規模言語モデルの事前学習においていかに最適なパフォーマンスを発揮できるかを示すために設計されています。
このデータセットには、10,193,029件の教育記録が含まれており、総トークン数は100億を超え、学際分野、テクノロジー、科学、社会科、数学、生活技能、芸術と創造性、言語芸術、哲学と倫理の9つの主要分野を網羅しています。データは確立された教育パラダイムに従っており、基礎から応用まで10段階の難易度で、優れた階層構造と体系的な組織化が示されています。
オンラインで実行:https://go.hyper.ai/skT3q
9. VisCoR-55K ビジュアル推論データセット
VisCoR-55Kは、華中科技大学がアリババクラウドと共同で2026年に公開した、高品質な視覚推論データセットです。このデータセットには約55,000個の視覚推論サンプルが含まれており、それぞれのサンプルは対照的なサンプルを用いて対応する推論プロセスを生成します。一般、推論、数学、グラフ作成、OCRの5つのカテゴリを網羅した、高品質な視覚推論データセット。その目的は、信頼性が高く堅牢な視覚的推論における視覚言語モデルに関する研究を促進することである。
オンラインで実行:https://go.hyper.ai/kIlWk
選択された公開チュートリアル
1. MiniCPM-Robot:現実世界のための具現化された知能モデル
MiniCPM-Robotは、OpenBMBが提供する、現実世界における知覚、意思決定、および行動のための具現化された知能モデル群です。最初のリリースには、ロボット操作のための汎用VLAモデルであるMiniCPM-RobotManipと、具現化されたターゲット追跡のためのエッジモデルであるMiniCPM-RobotTrackの2つのモデルが含まれています。
オンラインで実行:https://go.hyper.ai/0VsYI

2. Diamond-1.0: 自己回帰型音声復元モデル
Diamondは、2026年7月にnineninesix.aiによって開発された音声復元モデルです。自己回帰型のseq2seqアーキテクチャを使用して、劣化した音声(低ビットレートエンコーディング、バックグラウンドノイズ、クリッピング、狭帯域)を44.1kHzのスタジオ品質に近い音声に復元します。
オンラインで実行:https://go.hyper.ai/OHZ6o

3. Nanbeige4.2-3B: コンパクトインテリジェントエージェントモデル
Nanbeige4.2-3Bは、Nanbeigeが2026年7月に開発したコンパクトなエージェントモデルで、Nanbeige4.2-3B-Baseをベースに構築されています。このモデルはループ型トランスフォーマーアーキテクチャを採用しており、トランスフォーマー層を再利用することで、パラメータ数を増やすことなくモデル容量を向上させています。非埋め込みパラメータはわずか3B(合計4B)で、エージェントベンチマークテストではQwen3.5-9BやGemma4-12Bといった大規模モデルを凌駕しています。
オンラインで実行:https://go.hyper.ai/KI1QR

4. Fara 1.5-27B: インテリジェントエージェントを用いたマルチモーダルコンピュータ
Fara1.5-27Bは、Microsoft Research AI Frontiersが2026年5月にリリースしたマルチモーダルコンピュータエージェントです。その中核となる革新は、視覚のみに基づく知覚アーキテクチャです。スクリーンショットを通してブラウザを観察し、DOMにアクセスすることなく、構造化されたツール呼び出し(クリック、入力、スクロール、Webページ検索など)を使用してエンドツーエンドのタスクを完了します。このモデルはQwen3.5-27Bをベースに、FaraGen1.5マルチエージェントプロセスから生成されたトレーニングデータを用いて、教師あり学習でファインチューニングされています。
オンラインで実行:https://go.hyper.ai/9AwuJ

5. NVIDIA Cosmos3-Edge: フルモーダル推論モデル
Cosmos3-Edgeは、NVIDIAチームが2026年7月にリリースした40億パラメータのマルチモーダルワールド基盤モデルです。その中核となる革新性と特徴は、ハイブリッドTransformer(MoT)アーキテクチャを採用している点です。このアーキテクチャは、自己回帰型Transformerと拡散型Transformerを統一されたフレームワークに統合し、それぞれテキスト生成と画像/動画/アクションなどのマルチモーダル生成を処理します。
オンラインで実行:https://go.hyper.ai/yB4bz

6. Mage-Flow:ネイティブ解像度画像の効率的な生成と編集のための基本モデル
Mage-Flowは、2026年7月にMicrosoftがリリースした、コンパクトな4B画像生成・編集基盤モデルです。トークナイザー、バックボーン、システムの協調最適化を綿密に設計することで、4Bパラメータ規模でありながら、より高速な推論速度と低いメモリ使用量を維持しながら、より大規模なモデル(Qwen-Image 20B、FLUX.2 32B)に匹敵する品質を実現しています。
オンラインで実行:https://go.hyper.ai/3cw36

7. LingBot-World-V2: 無限の世界と多様なインタラクションによる画像から動画への生成
LingBot-World-V2は、Robbyantチームが2026年7月にリリースした画像から動画への生成モデルです。このモデルは、因果関係に基づく事前学習によって無限に長いインタラクションを実現しつつ、安定した出力品質を維持します。また、リアルタイム720p 60fpsの動画生成に対応し、攻撃、弓術、魔法詠唱など、多様なインタラクティブ機能を備えています。さらに、LingBot-World-V2は、世界モデルにインテリジェントエージェントフレームワークを初めて導入し、行動計画エージェントと環境合成エージェントを通して、より高度なシーン理解とインタラクション生成を実現しています。
オンラインで実行:https://go.hyper.ai/wecWC

8. MOSS-Transcribe-Diarize:エンドツーエンドの複数話者音声文字起こしと話者分離
MOSS-Transcribe-Diarizeは、MOSI.AI(OpenMOSS)チームが2026年7月にリリースした、エンドツーエンドのマルチスピーカー音声理解モデルです。このモデルは、1回の推論だけで、音声の書き起こしと話者分離を同時に完了し、タイムスタンプと匿名話者ラベル([S01]、[S02]など)を含む構造化テキストを出力します。
オンラインで実行:https://go.hyper.ai/TElI9

💡安定拡散チュートリアル交換グループも設立しました。お友達はコードをスキャンして [SD チュートリアル] にメモし、グループに参加してさまざまな技術的な問題について話し合い、アプリケーションの効果を共有してください。

コミュニティ記事の解釈
1. 米国のアルゴンヌ国立研究所は、計算化学分野における薬剤の価値を評価するために13のベンチマークテストを用いるChemGraphを提案した。
アルゴンヌ国立研究所は、計算化学における分子シミュレーションのワークフローを自動化するために特別に設計された、LLM(論理リカレントモデル)搭載のインテリジェントエージェント「ChemGraph」を発表しました。ベンチマークテストでは、GPT-4oなどの大規模モデルが複雑なタスクで安定したパフォーマンスを発揮することが示されていますが、タスクを戦略的に分割することで、GPT-4o-miniなどの小規模モデルでもパフォーマンスを大幅に向上させ、大規模モデルのパフォーマンスに匹敵、あるいはそれを上回ることも可能です。この研究は、科学研究におけるAIの低コスト自動化に向けた新たなアプローチを提供します。
レポート全体を表示します。https://go.hyper.ai/Cgo56
2. スタンフォード大学のAI X線科学者たちは、大規模モデル推論とMCPツールの使用に基づき、シンクロトロン放射光源において単結晶回折アライメントを自律的に完了させた。
スタンフォード大学とSLAC国立加速器研究所の研究チームは、「AI X線科学者」システムを開発し、スタンフォード大学のシンクロトロン放射光源の実際のビームラインに導入した。チームはまず仮想ビームラインでシステムをデバッグし、その後実際の装置に移行した。テストには、単結晶方位行列の解を求めるタスクを用い、AIが複数の実験ステップを自律的に完了し、実際の環境で予期せぬずれに対処できるかどうかを検証した。
レポート全体を表示します。https://go.hyper.ai/jF9qk
人気のある百科事典の項目を厳選
1. 人間と機械のループ(HITL)
2. 自動音声認識(ASR)
3. 光学文字認識(OCR)
4. 世界行動モデル(WAM)
5. 思考主導型強化学習フレームワーク(GTR)
ここには何百もの AI 関連の用語がまとめられており、ここで「人工知能」を理解することができます。
サミットの締め切りは8月
上記は、今週編集者が選択したすべてのコンテンツです。hyper.ai 公式 Web サイトに掲載したいリソースがある場合は、お気軽にメッセージを残すか、投稿してお知らせください。
また来週お会いしましょう!








