行业观察

DeepSeek 多模态上新:V4-Flash-Vision-Exp 上线 API,视觉 Agent 能力接近 Opus 4.8

发布日期 2026-08-24 作者 信息来源 澎湃新闻 · https://www.thepaper.cn/newsDetail_forward_33825583 · 2026-08-21 标签 AI原生组织 / 自身即产品 / 上线
DeepSeek 8月21日上线实验性多模态视觉理解模型 V4-Flash-Vision-Exp,视觉 Agent 能力接近 Opus 4.8,图片按 token 计费且价格与 V4-Flash 一致。

8月21日,DeepSeek 宣布实验性多模态视觉理解模型 V4-Flash-Vision-Exp 上线其 API 平台,正式开启多模态 API 服务。据介绍,该模型在 Agent、推理、世界知识等纯文本任务上与 DeepSeek-V4-Flash 正式版持平;而在需要视觉理解的 Agent 基准测试中,成绩相较 V4-Flash 大幅跃升,多模态 Agent 能力已接近 Opus 4.8。

计费方面,图片会转换成 token 按量计费,单张图片最多占用 384 tokens,价格与 V4-Flash 保持一致,开发者只需将 model 参数设为 deepseek-v4-flash-vision-exp 即可调用。同步推出的还有 Files API:图片文件上传一次后,可在不同请求中通过 file_id 反复引用,无需重复上传。

同一天,DeepSeek Harness 宣布更新并支持官方多模态,开发者预览版自 v0.1.0-rc.6 发布以来已连续完成三个版本迭代,重点覆盖多模态能力、子代理协作、跨平台兼容与使用体验。官方演示案例包括在 Agent 框架下生成商业定制自驾游 PPT、对官网进行二次创作,以及制作黏土怪物风格动态特效前端 Demo。

【AICOR 点评】DeepSeek 把视觉能力做成“Agent 原生”而非单纯的看图工具,方向踩得很准。对企业而言,视觉理解的真正价值在于让智能体直接读懂界面、图表与文档,进入业务流程的执行环节。配合 Files API 与 Harness 生态,企业搭建多模态人机协同工作流的门槛正快速下降,值得产研团队尽快纳入选型评估。

版权声明 本文由 AI 辅助整理,基于公开报道转写,信息版权归原作者及原媒体所有;内容仅作行业信息分享,不构成任何投资或商业建议。

如涉版权问题,请联系 AICOR(400-601-8080 / 微信 aicor-ai),我们将在收到通知后及时处理。

← 返回新闻列表