DeepSeek API 正式支持图像理解(Vision)
deepseek-v4-flash-vision-exp 模型现已支持图片输入,可进行图像描述、文字识别、图表分析等任务,支持 Base64、外部 URL 和 Files API 三种传图方式。
发生了什么
DeepSeek API 官方文档新增「图像理解」指南,deepseek-v4-flash-vision-exp 模型现已正式支持在文本之外输入图片。用户可让模型描述图片内容、识别截图中的文字、分析图表、理解视觉信息等。
这是 DeepSeek 在多模态能力上的重要更新,模型同时兼容 OpenAI、Anthropic 和 Responses API 三种接口风格。
主要变化
支持的图片格式
- JPEG、PNG、GIF、WebP(按文件实际内容判断)
三种传图方式
-
Base64 内联(最简单)
将图片转为data:image/jpeg;base64,...格式直接嵌入请求。适合本地文件,但受 48 MiB 请求体大小限制。 -
外部图片 URL
传入可公开访问的 http(s) 链接,模型自动下载。URL 最长 8192 字符,图片最大 32 MiB,需在 60 秒内完成下载。 -
Files API(推荐复用场景)
先通过 Files API 上传图片获得file_id,后续请求直接引用该 ID。单张图片最大支持 64 MiB,且不受单次请求体 48 MiB 限制,适合多轮对话或多次引用同一张图片。
细节级别(detail 参数)
low:缩放至 512×512,速度快、省 tokenhigh/original:保留原图auto:自动选择(当前等价于 original)
Token 用量规则
- 图片进入模型前会自动缩放:总像素小于约 384×384 的保持长宽比放大;更大的图片保持长宽比缩小至约相当于 800×800 的尺寸。
- 每张图片 token 上限约 384 个(无论原始尺寸多大)。
- 多张图片时每张独立计算。
限制
- 单个请求最多 600 张图片
- 单张图片最大尺寸:单边最长 8192 像素(15 张以上时降为 4096 像素)
- 仅
deepseek-v4-flash-vision-exp模型支持图片,其他模型会返回 400 错误 - 图片仅可出现在 user 消息中
对用户有什么影响
- 开发者:现在可以直接在 API 调用中混入图片,实现图文混合问答、截图解析、图表理解、视觉问答等场景,无需额外模型切换。
- 成本:图片按 token 计费,缩放规则使得大图成本可控;Files API 适合高频复用场景降低上传开销。
- 兼容性:同时支持 OpenAI Chat Completions、Anthropic Messages 和 Responses API 三种格式,迁移成本低。
相关背景
此前 DeepSeek 以纯文本推理见长,此次 Vision 能力的加入使其在多模态应用场景(如文档处理、界面理解、视觉搜索辅助等)更具竞争力。官方文档提供了完整的代码示例和 cURL 示例,开发者可直接参考接入。