DeepSeek 今天给 V4-Flash 补上了视觉能力。
新模型叫 DeepSeek-V4-Flash-Vision-Exp,一个实验性质的版本,已通过 deepseek-v4-flash-vision-exp 这个 model id 在 DeepSeek API 平台上开放调用。
纯文本不降级,视觉大幅跃升
最关键的指标:在纯文本能力(Agent、推理、世界知识等)上,Vision-Exp 与 V4-Flash 正式版持平。说明加视觉没有牺牲文本侧的推理能力。
而在需要视觉理解的 Agent Benchmark 上,Vision-Exp 相比 V4-Flash 实现了大幅跃升,多模态 Agent 能力已接近 Opus 4.8。图片按照 token 计费,一张最多占 384 tokens,价格与 V4-Flash 模型一致。

三个 Agent 场景示例
DeepSeek 展示了三个多模态 Agent 长任务示例:做商业定制西藏自驾游 PPT(一个月行程、藏南+藏北、无人区级别体验、三种定价方案),用黑蓝深海和玻璃 UI 重构 DeepSeek Harness 官网(长多轮交互),以及制作黏土怪物风格动态特效的前端 Mini Demo。这些都不是简单的单轮看图问答,而是需要视觉理解作为输入的多步 Agent 工作流。

Files API 也一起上线了
Files API 开放,不收费。用户可先将图片上传到平台,再通过 file_id 引用,同一张图片在多个请求中无需重复上传。多模态 API 支持 Chat Completions、Messages、Responses 三种格式,图片传入方式支持 base64 内联、外部 URL 和 Files API 三种。
参考来源:https://mp.weixin.qq.com/s/UGMfvPMwBIB4oFYZZejekA