Command Palette
Search for a command to run...
テキスト/LaTeX/HTMLテーブルをワンステップで処理!OvisOCR2はエンドツーエンドのインテリジェントなドキュメント解析を実現。14,000以上の要素注釈、数万の言語コマンドを搭載!Voxel51は屋内シーンのマイクロインタラクションデータセット「SceneFun3D」をリリース。
ATH-MaaS、アリババなどが2026年7月に発表したOvisOCR2は、わずか0.8B(約1.7GB)のパラメータで構成された、コンパクトなエンドツーエンドの文書解析モデルです。Qwen3.5-0.8Bをベースに構築されたこのモデルは、文書画像を自然な読み順を維持したまま構造化されたMarkdown形式に直接変換し、テキスト、数式、表、および表示領域を正確に解析できます。革新的なハイブリッドデータエンジンと多段階(SFT、RL、OPD)トレーニング方式を採用したOvisOCR2は、OmniDocBench v1.6ベンチマークで96.58のスコアを達成し、従来のパイプライン方式を凌駕する初のエンドツーエンドモデルとなりました。極めて低い導入コストと卓越したパフォーマンスとの完璧なバランスを実現しています。
HyperAIのウェブサイトに「OvisOCR2:0.8Bエンドツーエンド文書解析モデル」が掲載されましたので、ぜひお試しください!
オンラインでの使用:https://go.hyper.ai/1qOnc

より詳しい情報については、弊社の公式ウェブサイトをご覧ください。
hyper.aiの公式サイトにおける7月18日から7月24日までの更新内容の概要は以下のとおりです。
* 高品質な公開データセット:9件
* 厳選された高品質のチュートリアル:9
* コミュニティ記事分析:1件
* 人気のある百科事典のエントリ: 5
8月締切の主要カンファレンス:6件
公式ウェブサイトにアクセスしてください:ハイパーアイ
公開データセットの選択
1. SceneFun3D 3Dシーン機能インタラクションデータセット
SceneFun3Dは、Voxel51が2024年に公開した3Dシーン機能インタラクションデータセットです。このデータセットは、微細なインタラクティブパーツのきめ細かな理解に焦点を当てており、パーツの位置特定、ギブソン関数の推論、モーションパラメータの推定、自然言語によるタスク記述などを網羅しています。データセットには、710の高解像度実世界屋内シーンが含まれており、14,867個の機能インタラクション要素の注釈、9つの機能カテゴリ、14,279個のモーションパラメータ、そして10,913個を超える自然言語によるタスク指示が収録されています。
オンラインでの使用:https://go.hyper.ai/g81mC
2. ヴァーグデーヌ・サンスクリット語朗読コーパスデータセット
Vāgdhenuは、主にサンスクリット語音声合成のトレーニング、韻律研究、および言語アクセシビリティアプリケーションを目的とした、一人の人物によるサンスクリット語詠唱録音のコーパスです。このデータセットには、合計約5.3時間の音声セグメントが1,467個含まれており、24kHzモノラルWAV形式です。データセットには、style_aとstyle_bという2つの独立したサブセットがあり、それぞれ多数の異なる詩句を網羅しています。
オンラインでの使用:https://go.hyper.ai/D7Q6H
3. 数学グラフ 数学定理依存関係グラフデータセット
Math-Graphは、ワシントン大学数学人工知能研究所が2026年に公開した、数学定理の依存関係グラフのデータセットです。このデータセットは、数学定理のステートメントレベルの依存関係グラフを構築します。47,952組の非形式的および形式的な数学ステートメントのペアが含まれており、これら2種類の数学的知識を整合性のある依存関係グラフに統合しています。論文のメタデータ、数学ステートメント、依存関係エッジ、およびLLMによって生成された自然言語による説明など、非形式的および形式的な数学の両方を網羅しています。
オンラインでの使用:https://go.hyper.ai/CtIDb
4. GLM-5.2 エージェント相互作用軌跡データセット
GLM-5.2 Agentは、TeichAIがTeichを使用して生成した、GLM-5.2モデル用の生のエージェント相互作用軌跡のデータセットです。エージェントモデルのトレーニングと設計のための標準化された解析可能なセッション記録を提供し、その後の微調整とツール呼び出し機能の強化をサポートすることを目的としています。
オンラインでの使用:https://go.hyper.ai/itLRp
5. EVA-Benchエンドツーエンド音声エージェントベンチマークデータセット
ServiceNowがリリースしたEVA-Benchは、音声エージェントのタスク完了能力と対話型エクスペリエンスを評価するために設計された、エンドツーエンドの音声エージェント評価ベンチマークデータセットです。このデータセットには、航空会社の顧客サービス管理、医療機関の人事サービス、企業ITサービス管理という3つの企業領域を網羅する213のシナリオが含まれています。マルチターン音声対話、ツール呼び出し、タスク完了、音声シナリオの堅牢性など、包括的な評価をサポートします。
オンラインでの使用:https://go.hyper.ai/51B4l
6. メタ認知ベンチデータセット
ginigen-aiが公開したMetacognition-Benchは、大規模言語モデルのメタ認知能力を評価するためのベンチマークデータセットです。最終的な回答の正確さを評価するだけでなく、モデルが自身の推論エラーを検出し、自己修正する機能的なメタ認知能力を測定することを目的としています。このデータセットには、数学、物理学、生物学、法律、医学、経済学、統計学、倫理学、コンピュータサイエンスなど、121分野にわたる300のメタ認知トラップ問題が含まれています。自己修正、トラップからの脱出、変換検出、競合解決、漸進的発見、多重制約処理、専門家パネル、不確実性意思決定という8つのメタ認知行動タイプを網羅しています。
オンラインでの使用:https://go.hyper.ai/8qdca
7. SVGベンチマーク:静止画像生成のためのベンチマークデータセット。
SVG Benchmarkは、Rapidaが2025年に公開した大規模なモデル静止画像生成評価データセットです。このデータセットは、最先端の大規模言語モデル30種類が、テキストプロンプトに基づいて静止SVGを生成する能力を、人間の評価を通じて比較することを目的としています。データセットはペアワイズ比較形式で収集されており、人間が作成した、または公開されているデータセットからの英語プロンプト500個、画像比較サンプル188,754個、および人間の投票に基づく選好回答1,355,161件が含まれています。
オンラインでの使用:https://go.hyper.ai/13Rn2
8. IFStruct v1.0 構造化出力準拠ベンチマークデータセット
IFStruct v1.0は、Liquid AIが2026年にリリースした構造化出力準拠ベンチマークデータセットです。このデータセットは、大規模言語モデルが指定されたスキーマに準拠した構造化出力を生成する能力を体系的に評価することを目的としています。データセットには2,000個のプロンプトワードが含まれており、それぞれモデルはターゲットパターンに基づいて複数のインスタンスを生成する必要があります。プロンプトワードは、自然な対話、明示的なパス指示、生のJSONスキーマ、コードブロック要件、および追加テキストなしなど、さまざまな形式で提示され、すべてに厳密な基盤となるスキーマ検証仕様が付随しています。
オンラインでの使用:https://go.hyper.ai/3NUcg
9. EdgeBench インテリジェントエージェント向け実世界学習ベンチマークデータセット
EdgeBenchは、ByteDance Seedが2026年に公開した、インテリジェントエージェント向けの現実世界学習ベンチマークデータセットです。自律型AIエージェントが現実世界の環境から学習する能力を評価することを目的としています。このデータセットには134の現実世界のタスクが含まれており、そのうち51はオープンソースです。タスクは、科学計算と機械学習、システムとソフトウェアエンジニアリング、最適化、知識推論、形式推論、ゲーム理論の6つの能力カテゴリを網羅しています。
オンラインでの使用:https://go.hyper.ai/FqmX7
選択された公開チュートリアル
1. OvisOCR2: 0.8B エンドツーエンド文書解析モデル
ATH-MaaSチームが2026年7月にリリースしたOvisOCR2モデルは、コンパクトな0.8Bのエンドツーエンド文書解析モデルです。このモデルは、Qwen3.5-0.8Bで事後学習を行い、綿密に設計されたデータエンジン(実データと合成データの組み合わせ)と、SFT、RL、OPDを統合した多段階学習戦略を採用して構築されています。
オンラインで実行:https://go.hyper.ai/1qOnc

2. RoBERTa ツイート感情テキスト抽出
RoBERTaモデルは、FacebookのAIチームによって2019年7月にリリースされました。その中核となる革新性と特徴としては、動的マスキング戦略の導入、より大規模なバッチトレーニング、BERTの上に構築されたより多くのトレーニングデータなどが挙げられ、これにより自然言語処理のベンチマーク性能が大幅に向上しています。
オンラインで実行:https://go.hyper.ai/8iZIz
3. handson-ml2 実践的な機械学習チュートリアル
これは、機械学習の基礎からディープラーニングまでを網羅した、実践的な機械学習チュートリアルの完全なコレクションです。このチュートリアルは、オーレリアン・ジェロンの古典的名著『Hands-On Machine Learning with Scikit-Learn, Keras, and TensorFlow』(第2版)に基づいています。
オンラインで実行:https://go.hyper.ai/jEyUh
4. Kerasディープラーニング基礎チュートリアル—乳がん分類
このチュートリアルは、Paras Jindal氏が2026年7月にKaggleで公開した入門的な深層学習プロジェクトを基にしています。Keras Sequential APIを使用してニューラルネットワークモデルを構築し、良性および悪性の乳がん細胞の特徴データを二値分類します。
オンラインで実行:https://go.hyper.ai/s1X9X

5.レコメンデーションエンジン(共同購入レコメンデーションエンジン)
共同購入推奨エンジンは、2022年2月に公開されたChris Deotte氏のKaggleノートブック「一緒に購入された商品の推奨」に基づいた推奨システムです。その核となるイノベーションは、過去の取引データを分析して共同購入マトリックスを構築し、頻繁に購入される商品を一緒に推奨することにあります。これは、過去の購入頻度、共同購入パターン、人気商品のバックアップという3つの戦略を統合したものです。このアルゴリズムは、H&Mのパーソナライズされたファッション推奨コンペティションでMAP@12スコア0.021を達成しました。
オンラインで実行:https://go.hyper.ai/fiegd
6. タイタニック・データサイエンス・ソリューションズ:機械学習をゼロから学ぶ
タイタニック号沈没事故からの機械学習は、Kaggleプラットフォームで最も古典的な入門コンペティションの1つです。このコンペティションの課題は、乗客の個人情報(客室クラス、性別、年齢、家族構成など)に基づいて、タイタニック号沈没事故で乗客が生き残ったかどうかを予測することです。
オンラインで実行:https://go.hyper.ai/gGUJO

7. 災害ツイートの分類:BERTを用いた自然言語処理テキスト分類
このチュートリアルは、Kaggle の xhlulu 氏の定番ノートブックを基に、BERT を使用して災害関連のツイートを二値分類する方法を解説します。完全な NLP プロジェクトを通して、このチュートリアルでは、データ読み込み → トークン化エンコーディング → モデル構築 → トレーニングとファインチューニング → 推論と予測という手順で、BERT テキスト分類パイプラインをゼロから構築する方法をガイドします。事前学習済みの BERT をカスタムの二値分類タスクに適用する方法や、[CLS] トークンやシグモイド出力層といった重要な設計上の選択の背後にある原理を理解できます。
オンラインで実行:https://go.hyper.ai/ENFgs
8. Ternary-Bonsai-27B: 7.2GB 三値量子化推論 27B
Ternary Bonsai 27Bは、Prism MLチームが2026年7月に開発した推論ベースの大規模言語モデルです。エンドツーエンドの三値量子化を採用したQwen3.6-27Bをベースとしています。このモデルはハイブリッドアテンションメカニズム(約75%の線形アテンション/約25%のフルアテンション)を採用し、最大262Kの超ロングコンテキストをサポートし、100Kトークンのコンテキストではピークメモリを約14.7GBしか必要としません。DSparkの投機的デコードアクセラレーションレイヤーを提供し、ロスレスデコード速度を1.34倍向上させます。
オンラインで実行:https://go.hyper.ai/OfSLw

9. Lyftモーション予測:ResNeXt50 FPNに基づく自動運転車の軌道予測
Lyft Motion Predictionは、Lyftが2020年に開催したKaggleコンペティションです。このコンペティションの課題は、自動運転シナリオにおける状況情報に基づいて、エージェント(車両、歩行者など)の次の5秒間(50タイムステップ、10Hz)の動きの軌跡を予測することです。
オンラインで実行:https://go.hyper.ai/vJYkN

💡安定拡散チュートリアル交換グループも設立しました。お友達はコードをスキャンして [SD チュートリアル] にメモし、グループに参加してさまざまな技術的な問題について話し合い、アプリケーションの効果を共有してください。

コミュニティ記事の解釈
1. ハーバード大学医学部などが、1万個以上の腫瘍サンプルを用いたトレーニングに基づいて、がん種を網羅する基本モデルであるCOMPASSを提案した。COMPASSは、平均して既存の22の手法を上回る性能を発揮する。
ハーバード大学医学部、ロシュ製薬、浙江大学の研究チームは、全がんを対象としたベースラインモデル「COMPASS」を提案した。このモデルは、33種類のがんから得られた10,184個の腫瘍サンプルを用いて学習され、7種類のがんと6種類の免疫チェックポイント阻害剤を対象とする16の臨床コホートで評価された。その結果、COMPASSは平均して既存の22の手法を上回り、異なるコホート間で予測精度を平均8.51 TP3T向上させることが示された。
レポート全体を表示します。https://go.hyper.ai/FyRsC
人気のある百科事典の項目を厳選
1. スキル
2. 世界行動モデル(WAM)
3. スケーリング法則
4. フレーム/秒
5. 自動音声認識
ここには何百もの AI 関連の用語がまとめられており、ここで「人工知能」を理解することができます。








