8月23日,DeepSeek正式推出实验性多模态模型deepseek-v4-flash-vision-exp,为其V4 Flash产品线首次引入图像理解能力。该模型支持JPEG、PNG、GIF和WebP格式的图片输入,可通过base64编码、URL引用或Files API三种方式传递图像,上下文窗口维持100万token,最大输出384K token。
在性能表现上,DeepSeek自测数据显示该模型在Deep Sway基准得分59.3,略高于Anthropic Opus 4.8的58分;在Agent Last Exam测试中取得27.3分,领先Opus 4.8约2个百分点。不过在Terminal Bench 2.1和Apex Bench等评测中仍落后于Opus 4.8。这些数据来自厂商自测,尚未经过独立第三方验证。
定价方面,该模型与V4 Flash保持同一档位,图片按尺寸转换为input token计费,无额外图片附加费。工作日高峰时段按高峰费率计算,其余时段执行低谷价。模型当前标记为实验性质,并发限制为2500。
该模型的发布意味着DeepSeek正在从纯文本推理赛道向多模态Agent领域扩展。低成本的视觉输入处理能力,使开发者可以构建截图解读、文档自动化、UI工作流执行等应用场景,进一步压缩了企业部署多模态AI的门槛。
【AICOR 点评】 DeepSeek以Flash产品线的成本结构承载视觉能力,释放出明确的信号:多模态不再是旗舰模型的专属特权,而是正在快速基础设施化。对于企业AI重构而言,这意味着视觉理解能力将从可选模块变为标配组件。当Agent可以低成本地看屏幕、读文档,人机协同的交互界面将发生根本性变化——未来的企业AI Agent不仅会说和想,更会看和做。
版权声明 本文由 AI 辅助整理,基于公开报道转写,信息版权归原作者及原媒体所有;内容仅作行业信息分享,不构成任何投资或商业建议。
如涉版权问题,请联系 AICOR(400-601-8080 / 微信 aicor-ai),我们将在收到通知后及时处理。