HyperAIHyperAI

Command Palette

Search for a command to run...

オンラインチュートリアル|ビジュアルエージェント登場!DeepSeek-V4の新モデルでベンチマークスコアが急上昇、ApexBenchは36.5を記録

Featured Image

DeepSeek-V4 シリーズが本格マルチモーダル化へ――初の実験的ビジョンモデル「DeepSeek-V4-Flash-Vision-Exp」がリリースされました!

DeepSeek-V4-Flash アーキテクチャを基盤としたマルチモーダル拡張版である DeepSeek-V4-Flash-Vision-Exp は、視覚モジュールの導入と継続的なトレーニングにより、従来のテキストエージェント機能を維持しつつ、視覚的理解能力を一層強化しました。このモデルは画像や図表などの視覚情報を統合して複雑なタスクを実行でき、特にマルチモーダル エージェントにおける環境認識とタスク処理能力の向上に焦点を当てています。

パフォーマンス面では、テキスト機能とマルチモーダル エージェント機能とのさらなるバランスを実現しています。テキストエージェント タスクのパフォーマンスをほぼ安定させたまま、ApexBench (Pass@1) が 26.2 から 36.5 に改善し、Agents' Last Exam では 27.3 を達成しました。また、Chartography や ZeroBench といったマルチモーダル評価ベンチマークでもそれぞれ 64.3 と 35.0 の好成績を収めています。さらに DeepSWE、NL2Repo、Toolathlon-Verified などのテキストエージェント テストにおいても、新モデルは競争力のある結果を示しています。

テキスト理解からビジュアル知覚へと進化し、DeepSeek-V4-Flash-Vision-Exp は DeepSeek-V4 シリーズにおいて新たなマルチモーダル エージェントの可能性を開きました。視覚的理解・推論およびツール呼び出し機能がさらに融合することで、エージェントは今後、複雑なタスク実行、図表解析、インターフェース操作など、現実世界の応用シーンでより高度な自律性を発揮することが期待されます。

現在、HyperAI チュートリアルセクションには「DeepSeek-V4-Flash-Vision-Exp マルチモーダル推論と Open WebUI デプロイメント」が公開されており、ワンクリックでモデルデプロイメントを完了し、その視覚的理解、マルチモーダル エージェント、そして複雑なタスク実行能力を迅速に体験することができます。

オンラインでの試運転:

https://go.hyper.ai/QtxhJ

その他のオンラインチュートリアルの詳細はこちら:

https://hyper.ai/notebooks

Demo ページ

Demo 実演手順

  1. hyper.ai ホームページに入り、「Tutorial(チュートリアル)」ページを選択するか、「View More Tutorials(他のチュートリアルを見る)」をクリックして「DeepSeek-V4-Flash-Vision-Exp マルチモーダル推論と Open WebUI デプロイメント」を選び、「Run this tutorial(このチュートリアルを実行)」をクリックします。
  1. リダイレクトされた画面右上にある「Clone」ボタンを押下し、自分のコンテナ内にこのチュートリアルをクローンしてください。

注意:画面右上では言語切り替えが可能です。現在は中国語と英語に対応しており、ここでは英語版を例として手順を紹介します。

3. 「NVIDIA H100 x4」と「vllm」イメージを選択し、「Continue job execution(ジョブの実行を続ける)」をクリックします。
  1. リソース割り当て待ちとなり、ステータスが「Running(稼働中)」になったら、「Open Workspace」をクリックして Jupyter Workspace にアクセスします。

動作確認

  1. リダイレクト後は左側の README ファイルをクリックし、開いた画面上部の Run ボタンを押下します。
2. プロセス終了後に新しいターミナルを開き、以下のコマンドを入力して Open WebUI を起動してください。
  1. 起動後、右側に表示される API アドレスをクリックするとブラウザで Open WebUI インターフェースが開きますので、ローカル モデルとの対話を開始できます。