会懂网AI资讯获悉,DeepSeek在API平台上线实验性多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp,开发者可通过指定模型名调用,支持图像理解,价格沿用Flash档。
这是DeepSeek首次在托管API开放图像入口。此前DeepSeek的视觉研究(DeepSeek-VL、Janus系列)一直开源,但始终未在API开放图像理解能力。本次上线被视为其补齐多模态、直面GPT-4V、Gemini Vision、Claude视觉竞争的实质动作。
DeepSeek官方表示,V4 Flash多模态实验版的文本能力与DeepSeek-V4-Flash相当,包括智能体、推理和世界知识。模型可分析图像、屏幕截图等视觉提示并采取行动,直接对标Anthropic Claude Opus 4.8。Files API同步被视为多模态Agent与长流程办公自动化的关键拼图,适用产品截图分析、文档OCR、多模态办公等场景。
业内分析认为,视觉入口开放后,国内开发者在多模态Agent上的成本与合规门槛进一步降低。对中小企业而言,Flash档定价意味着可低成本试点”看图”能力,但实验性质意味着生产环境仍需观望稳定性与速率限额。
从产业格局看,DeepSeek的多模态突袭,标志着中国大模型竞争进入”全栈对标”阶段——不再满足于文本能力追赶,而是在视觉理解、Agent执行、工具调用等全维度与Anthropic、OpenAI正面交锋。DeepSeek Harness开源生态也在持续扩圈,已接入国家超算互联网、腾讯QQ、企业微信、阿里云等平台。






























暂无评论内容