IT之家 · 原文 2026-09-10

DeepSeek V4.1 Flash 发布:能看图,API 也降价了

能接收什么材料、调用要花多少钱,是这次更新最直接的两个变化。9 月 10 日发布的 DeepSeek V4.1 Flash 将原生图文理解、API 降价和同日工具接入放到了一起。

DeepSeek 官方四项智能体基准比较图,蓝色柱表示 V4.1 Flash。
DeepSeek 官方智能体评测图:四个测试、各自不同的任务与设置。它展示特定评测结果,不是识图效果演示或所有任务的排名。 · 打开大图
DeepSeek 官方全局 KV 缓存比较图:V4 Flash 为每 token 3514 字节,V4.1 Flash 为 890 字节。
DeepSeek 官方模型卡原图:保留上下文所需的全局 KV 缓存继续缩小。图中的存储变化不等同于 API 费用降幅。 · 打开大图
来源与文字说明

DeepSeek 9 月 10 日发布的 V4.1 Flash 原生处理图片和文字,再生成文字回答。截图、图表、带有文字的图片,都可以成为提问的材料:例如把一张界面截图和操作问题一起提交,让模型结合两者解释。这里新增的是图像理解,不是生成图片。

官方模型卡列出的上下文上限为 100 万 tokens,也给出了文档问答和视觉任务的评测结果。文中的评测图是官方选取的四项智能体测试,用来展示它在不同任务中的表现;这些分数不能直接换算成处理你手头文件的成功率。

DeepSeek 同步下调了 V4.1 Flash 的 API 单价。每百万 tokens,空闲时段的输入价格为缓存命中 0.02 元、未命中 1 元,输出 4 元;高峰时段对应为 0.04 元、2 元和 8 元。缓存命中指服务复用了已缓存的输入,不能把所有输入都按最低一档计算。

按这一单价举例:100 万个未命中缓存的输入 tokens,加上 10 万个输出 tokens,空闲时段为 1.40 元,高峰时段为 2.80 元。它只是用量计算示例;一项实际任务可能经历多轮调用、生成更多内容,最终以实际 token 用量计费。

架构也在减少保存长上下文的开销。官方图中,全局 KV 缓存从 V4 Flash 的每 token 3514 字节降至 890 字节,约为原来的四分之一。图里比较的是模型缓存占用;API 账单仍按公布的单价和实际用量计算。

同日,IT之家报道 DeepSeek Harness 0.1.5 已适配 V4.1 Flash,并增加文件上传、侧边栏文件预览,改善长会话的性能。模型能够理解更多材料,使用界面也提供了提交和查看文件的入口,两项更新可以放在一起继续观察。本站已收录这次 Harness 更新,可从下方关联阅读接着查看。

直接调用 API 的开发者可使用模型名 deepseek-flash。官方说明,旧名 deepseek-v4-flash 与 deepseek-v4-flash-vision-exp 的请求暂时由 V4.1 Flash 提供服务;因此,原先使用旧名称的工具也需要留意实际模型已经变化。

本文依据 2026 年 9 月 10 日的官方模型卡、API 更新与价格页;Harness 0.1.5 的功能信息来自同日 IT之家报道。高峰为北京时间周一至周五 9:00—12:00、14:00—18:00,其余时段为空闲。官方评测采用指定推理强度、工具框架与上下文设置;配图保留原图和署名,未据此承诺全面领先。价格可能调整,后续以官方价格页为准。