Command Palette
Search for a command to run...
TimesFM 3.0 ゼロショットで時系列を予測し、多様なシナリオの分析ニーズをカバー;VLX-Seek は目標定位と細粒度理解を融合し、具身視覚知覚能力を拡張する

VLX-Seek は、OmAI Lab が2026年7月に発表した、細粒度認識を備えた視覚言語モデルであり、ロボットやドローンなどのエッジデバイスにおける具現化視覚アプリケーションを対象としています。 実際のタスクにおいて、指示がどの物体を指しているのかを特定することが難しいという問題に対し、本モデルは言語理解と領域レベルの視覚認識を組み合わせ、対象の特徴や指示関係に基づく探索をサポートし、選択した領域を中心に文字認識、内容説明、カウントを実行します。さらに、対象が存在しない場合の拒否認識メカニズムを導入し、その後の検索やタスク調整の根拠を提供します。VLX-Seek は、視覚モデルの応用の焦点を、特定のオブジェクトの識別とインタラクションへとさらに拡張し、具現化インテリジェントシステムが環境認識と行動決定を結びつけるための基盤能力を提供します。
現在、HyperAI 公式サイトでは「VLX-Seek:細粒度認識を備えた視覚言語モデル」を公開しています。ぜひお試しください~
オンライン利用: https://go.hyper.ai/oeM9
9月18日〜9月24日、hyper.ai 公式サイト更新ダイジェスト:
-
高品質パブリックデータセット:5件
-
厳選チュートリアル:8件
-
人気百科事典エントリー:5件
-
10月締切のトップ会議:5件
公式サイトへアクセス:hyper.ai
パブリックデータセット厳選
1. GooseReason-0.7M 強化学習検証推論データセット
GooseReason-0.7M は、NVIDIA が2026年に公開した大規模な強化学習検証推論(RLVR)データセットです。検証可能なトレーニングデータが不足しているというボトルネックを解決することを目的としており、Golden Goose パイプラインを通じて、推論が豊富なインターネットテキストから無制限の RLVR タスクを合成します。このデータセットには、数学、プログラミング、一般科学の分野をカバーする70万以上のタスクが含まれ、データ規模は0.7M レベルに達し、主に GooseReason-4B-Instruct モデルのトレーニングに使用されます。このモデルは、数学、プログラミング、STEM 推論、指示追従、論理パズルをカバーする15のベンチマークにおいて、4B レベルモデルの新たな最先端結果を達成しました。
オンライン利用:https://go.hyper.ai/eQ6X7
2. GR1-100 ロボット操作デモンストレーションデータセット
GR1-100 は、NVIDIA が2025年に公開した、92のビデオクリップを含むロボット操作データセットであり、ロボットトレーニングに高品質なビデオデータを提供することを目的としています。データは MP4 形式で、総サイズは約142.3 MB であり、コンピュータビジョンとロボット学習分野の研究に適しています。このデータセットは、主に GR1-T2 と呼ばれる Fourier ロボットが実験室環境でさまざまなタスクを実行する様子を、第三人称視点で記録したビデオです。
オンライン利用:https://go.hyper.ai/BulTI
3. GraspGen: Scaling Sim2Real Grasping 把持生成データセット
GraspGen: Scaling Sim2Real Grasping は、NVIDIA が2025年に公開した大規模なシミュレーション把持データセットです。このデータセットには、Objaverse XL (LVIS) データセット内の8,515個のオブジェクトに基づいて生成された、5,700万回以上の把持データが含まれており、Franka Panda、Robotiq-2f-140 産業用グリッパー、および単点接触吸盤グリッパー(30 mm 半径)向けに設計されています。大規模なシミュレーションデータを通じて、ロボットの把持スキルのシミュレーションから現実への転移能力を向上させることを目的としています。データセットは WebDataset 形式で、全体で5,700万回以上のシミュレーション把持データを含み、3種類の異なるタイプのロボットグリッパーをカバーしており、ロボット把持、シミュレーションから現実への転移(Sim2Real)、ロボット学習などの分野の研究に適しています。
オンライン利用:https://go.hyper.ai/81LdN
4. LiveCodeBench-CPP コード生成評価データセット
LiveCodeBench-CPP は、NVIDIA が2025年に公開した C++ コード生成評価データセットであり、大規模言語モデルに最新のプログラミング問題に基づくコード生成およびデバッグ能力の評価ベンチマークを提供することを目的としています。このデータセットには454のプログラミング問題が含まれており、主に AtCoder(287問)と LeetCode(167問)から提供され、2024年10月から2025年5月までのコンテストと問題をカバーしています。データには、問題の説明、プラットフォームの出典、難易度、テストケース、および関連するメタデータが含まれており、主に実在のプログラミングタスクにおけるモデルのコード生成および問題解決能力を評価するために使用されます。
オンライン利用:https://go.hyper.ai/YdSXz
5. HelpSteer 有用性アライメントデータセット
HelpSteer は、NVIDIA が2023年に公開した大規模言語モデルのアライメント用データセットであり、モデルの回答の有用性、正確性、一貫性を向上させ、応答の複雑さと詳細度を調整することをサポートすることを目的としています。このデータセットには37,120のサンプルが含まれており、書き換え、要約、分類、抽出、質問応答など、さまざまなタスクタイプをカバーしています。各サンプルには、プロンプト、モデルの応答、および人間がアノテーションした有用性、正確性、一貫性、複雑さ、詳細度の5つの属性スコア(0〜4の範囲)が含まれています。データは Scale AI によってアノテーションされており、主に大規模言語モデルのトレーニング、評価、モデルアライメント研究に使用されます。
オンライン利用:https://go.hyper.ai/B5OPS
公開チュートリアル厳選
1. TimesFM 3.0:ゼロショット時系列予測
TimesFM 3.0 は、Google Research が 2026 年 8 月に発表した時系列基盤モデルで、事前学習済みのゼロショット予測方式を採用し、特定タスク向けのファインチューニングなしで新しい時系列を予測できます。このモデルは単変量・多変量・共変量入力をネイティブにサポートし、ゼロショット汎化能力を強化しており、小売売上、金融分析、天気・エネルギー需要、サプライチェーン予測などの時系列分析シナリオに活用できます。
オンライン実行:https://go.hyper.ai/DRk3i
デモページ
2. VLX-Seek:細粒度認識ビジョン言語モデル
VLX-Seek は、OmAI Lab が 2026 年 7 月に発表した細粒度ビジョン言語モデル(VLM)で、エッジ側の具身視覚シナリオを対象とし、画像内容の理解と同時に、目標位置特定、インスタンス識別、細粒度視覚認識を実現します。このモデルは物体検出、参照表現理解、領域記述、領域 OCR、カウンティング・推論検出をサポートし、オープン語彙拒否メカニズムにより、対象が存在しない場合は None を出力します。ロボット、ドローンなどの具身知能シナリオに使用できます。
オンライン実行:https://go.hyper.ai/oeM92
デモページ
3. Breeze TTS 2 — オープンソースのリアルタイム音声合成モデル
Breeze TTS 2 は、BreezeBlue チームが 2026 年 8 月に発表したオープンウェイトの音声合成モデルで、リアルタイム音声対話シナリオを対象とし、自然言語による音声デザイン、声クローン、感情制御をサポートします。このモデルは中英バイリンガルに対応し、テキスト命令でトーン、話速、感情を調整でき、笑い声やため息などのサウンドイベントや超低遅延ストリーミング生成もサポートします。リアルタイム音声アシスタント、オーディオコンテンツ、吹き替えのローカライゼーション、バリアフリーサービスなどのシナリオに活用できます。
オンライン実行:https://go.hyper.ai/JStch
デモページ
4. 統計学習入門チュートリアル
このチュートリアルは、Kaggle ユーザー DATAI が 2018 年に公開したもので、Breast Cancer Wisconsin Diagnostic Dataset を例に、統計学習の基礎知識と一般的な分析方法をゼロから解説します。データ探索と可視化、平均と分散などの記述統計、累積分布関数、効果量と相関、仮説検定と p 値、正規分布と Z スコア計算を網羅しており、統計学習の初心者に適しています。
オンライン実行:https://go.hyper.ai/fVzMx
5. EfficientDet トレーニングチュートリアル:小麦穂物体検出
このチュートリアルは、Alex Shonenkov が Kaggle Global Wheat Detection コンペティション用に構築したトレーニングパイプラインに基づき、EfficientDet 物体検出モデルをゼロから実践します。環境設定と GPU チェック、コンペデータセットの読み込み、Albumentations データ拡張、EfficientDet-D5 モデル構築、完全なトレーニングフローを網羅しており、物体検出モデルのトレーニングと実践を学びたい開発者に適しています。
オンライン実行:https://go.hyper.ai/AtDMM
6. YuE2-3B:最先端オープンソース音楽生成モデル
YuE2-3B は、Multimodal Art Projection(m-a-p)チームが 2026 年に発表したオープンソース音楽生成モデルで、歌詞とスタイルプロンプトに基づき、ボーカルと伴奏を含む完全な楽曲を生成できます。このモデルは AR–NAR Mixture-of-Transformers アーキテクチャを採用し、メロディ+コード、メロディのみ、直接生成の3つのモードをサポートし、48 kHz ステレオ出力にも対応しています。テキストから音楽生成、楽曲カバー、スマート音楽編集などのシナリオに活用できます。
オンライン実行:https://go.hyper.ai/t4G7M
デモページ
7. FFmpeg ビデオプレイヤー開発チュートリアル:フレームキャプチャからシークまで
このチュートリアルシリーズは、Stephen Dranger が 2015 年に公開した古典的チュートリアル『An ffmpeg and SDL Tutorial』を基に、Python と FFmpeg コマンドラインツールで中核内容を再実装し、デジタル音声・映像の動作原理をゼロから解説します。コンテナ、ストリーム、コーデック、パケット、フレーム、タイムスタンプなどの基本概念を網羅し、実行可能な実験を通じてビデオ同期、オーディオ同期、メディアシークを段階的に実践します。プレイヤー、トランスコーディング、ストリーミング、コンピュータビジョン関連技術の学習に適しています。
オンライン実行:https://go.hyper.ai/rtrW4
8. MiniCPM5-2B:エッジ側 2B 級 SOTA 大規模モデル推論
MiniCPM5-2B は、OpenBMB が 2026 年 9 月に発表した 2B 級オープンソース大規模言語モデルであり、MiniCPM5 シリーズの2番目のモデルです。標準の LlamaForCausalLM アーキテクチャを採用し、エッジ側展開、ローカル推論、リソース制約のあるシナリオを対象としています。このモデルは最大 131K のコンテキストをサポートし、コード・数学推論、ツール呼び出し、Agent 機能を備えており、ローカル AI アシスタント、プログラミング支援、知識 Q&A、インテリジェントエージェントアプリなどのシナリオで使用できます。
オンライン実行:https://go.hyper.ai/D8jnq
デモページ
人気百科事典キーワード厳選
1. 光学文字認識 OCR
2. 世界動作モデル WAM
3. リモートセンシング Remote Sensing
4. グリッチトークン Glitch Token
5. 生成的プレトレーニング変換モデル GPT
ここでは数百件の AI 関連キーワードをまとめており、ここで「人工知能」を理解できます:
10 月締切のトップ会議
*締切時間は AoE 時間
AI 学術トップ会議をワンストップで追跡:https://go.hyper.ai/event
以上が今週の編集部厳選の全内容です。hyper.ai 公式ウェブサイトに収録してほしいリソースがあれば、コメントや投稿でお知らせください!
また来週お会いしましょう!







