HyperAIHyperAI

Command Palette

Search for a command to run...

在线教程 | 视觉Agent来了!DeepSeek-V4新模型跑分暴涨,ApexBench冲到36.5

Featured Image

DeepSeek-V4 系列正式迈向多模态——首个实验性视觉模型 DeepSeek-V4-Flash-Vision-Exp 正式发布!

作为 DeepSeek-V4-Flash 架构的多模态扩展版本,DeepSeek-V4-Flash-Vision-Exp 通过引入视觉模块并进行持续训练,在保留原有文本智能体能力的基础上,进一步解锁视觉理解能力。模型能够结合图像、图表等视觉信息执行复杂任务,重点强化多模态 Agent 的环境感知与任务处理能力。

性能表现方面,模型实现了文本与多模态 Agent 能力之间的进一步平衡:在保持文本智能体任务性能基本稳定的同时,ApexBench (Pass@1) 从 26.2 提升至 36.5,Agents' Last Exam 达到 27.3,并在 Chartography 和 ZeroBench 等多模态评测中分别取得 64.3 和 35.0 的成绩。在 DeepSWE、NL2Repo、Toolathlon-Verified 等文本智能体测试中,新模型同样展现出具有竞争力的表现。

从文本理解到视觉感知,DeepSeek-V4-Flash-Vision-Exp 为 DeepSeek-V4 系列打开了多模态 Agent 的新方向。随着视觉理解、推理与工具调用能力进一步融合,智能体有望在复杂任务执行、图表分析、界面操作等真实应用场景中展现更强的自主能力。

目前,HyperAI 教程板块已上线「DeepSeek-V4-Flash-Vision-Exp 多模态推理与 Open WebUI 部署」 ,支持一键完成模型部署,快速体验其视觉理解、多模态 Agent 与复杂任务执行能力~

在线运行:

https://go.hyper.ai/QtxhJ

更多在线教程:

https://hyper.ai/notebooks

demo 页面

Demo 运行

1.进入 hyper.ai 首页后,选择「教程」页面,或点击「查看更多教程」,选择「DeepSeek-V4-Flash-Vision-Exp 多模态推理与 Open WebUI 部署」,点击「运行此教程」。

2.页面跳转后,点击右上角「Clone」,将该教程克隆至自己的容器中。

注:页面右上角支持切换语言,目前提供中文及英文两种语言,本教程文章以英文为例进行步骤展示。

3.选择「NVIDIA H100 x4」以及「vllm」镜像,点击「Continue job execution(继续执行)」。

4.等待分配资源,当状态变为「Running(运行中)」后,点击「Open Workspace」进入 Jupyter Workspace。

效果展示

1.页面跳转后,点击左侧 README 文件,进入后点击上方 Run(运行)。

2.待运行完毕后,请打开新终端,执行以下命令启动 Open WebUI。

3.启动后,点击右侧 API 地址即可在浏览器中访问 Open WebUI 界面,开始与本地模型对话。