会懂网AI资讯,9月5日,DeepSeek于8月31日在Hugging Face开源V4-Flash-Vision-Exp模型权重(MIT协议),这是V4家族首款多模态模型,规模约3050亿参数。官方强调,这双”眼睛”不是给人看图,而是给Agent用。

该模型在V4-Flash架构上加入视觉模块,能直接读取网页截图、软件界面、图表后调用工具执行任务。基准上,其DeepSWE得分达59.3,超过Claude Opus 4.8的58.0,多模态Agent能力”接近Opus 4.8″。这一步补齐了DeepSeek”模型+Harness+视觉”的Agent技术栈拼图。
与面向人类的图像生成不同,V4-Flash-Vision的设计目标是”为Agent装眼睛”。在智能体工作流中,模型需要理解屏幕内容、识别按钮与报错、读取图表数据,传统纯文本模型在此束手无策,而视觉能力的加入让Agent真正能”看”懂操作环境。
以MIT协议开源,意味着开发者可自由下载、修改与商用,延续了DeepSeek一贯的开放策略。该模型发布后迅速在开发者社区获得部署,成为开源多模态Agent领域的一支重要力量。
从行业趋势看,Agent正成为大模型竞争的新主战场。能否理解图形界面、操作软件、完成端到端任务,比单纯的语言能力更贴近真实生产力。DeepSeek此举,进一步降低了”视觉Agent”的技术与门槛。
会懂网观察,V4-Flash-Vision的发布,表明DeepSeek的重心正从”对话模型”转向”能干的Agent”。当开源模型也能”看图办事”,企业在自动化、RPA替代与软件操作上的想象空间将被显著打开。





















暂无评论内容