功能更新

DeepSeek API 正式支持图像理解(Vision)

发布于 来源:DeepSeek API 官方文档相关站点:DeepSeek

deepseek-v4-flash-vision-exp 模型现已支持图片输入,可进行图像描述、文字识别、图表分析等任务,支持 Base64、外部 URL 和 Files API 三种传图方式。

发生了什么

DeepSeek API 官方文档新增「图像理解」指南,deepseek-v4-flash-vision-exp 模型现已正式支持在文本之外输入图片。用户可让模型描述图片内容、识别截图中的文字、分析图表、理解视觉信息等。

这是 DeepSeek 在多模态能力上的重要更新,模型同时兼容 OpenAI、Anthropic 和 Responses API 三种接口风格。

主要变化

支持的图片格式

  • JPEG、PNG、GIF、WebP(按文件实际内容判断)

三种传图方式

  1. Base64 内联(最简单)
    将图片转为 data:image/jpeg;base64,... 格式直接嵌入请求。适合本地文件,但受 48 MiB 请求体大小限制。

  2. 外部图片 URL
    传入可公开访问的 http(s) 链接,模型自动下载。URL 最长 8192 字符,图片最大 32 MiB,需在 60 秒内完成下载。

  3. Files API(推荐复用场景)
    先通过 Files API 上传图片获得 file_id,后续请求直接引用该 ID。单张图片最大支持 64 MiB,且不受单次请求体 48 MiB 限制,适合多轮对话或多次引用同一张图片。

细节级别(detail 参数)

  • low:缩放至 512×512,速度快、省 token
  • high / original:保留原图
  • auto:自动选择(当前等价于 original)

Token 用量规则

  • 图片进入模型前会自动缩放:总像素小于约 384×384 的保持长宽比放大;更大的图片保持长宽比缩小至约相当于 800×800 的尺寸。
  • 每张图片 token 上限约 384 个(无论原始尺寸多大)。
  • 多张图片时每张独立计算。

限制

  • 单个请求最多 600 张图片
  • 单张图片最大尺寸:单边最长 8192 像素(15 张以上时降为 4096 像素)
  • 仅 deepseek-v4-flash-vision-exp 模型支持图片,其他模型会返回 400 错误
  • 图片仅可出现在 user 消息中

对用户有什么影响

  • 开发者:现在可以直接在 API 调用中混入图片,实现图文混合问答、截图解析、图表理解、视觉问答等场景,无需额外模型切换。
  • 成本:图片按 token 计费,缩放规则使得大图成本可控;Files API 适合高频复用场景降低上传开销。
  • 兼容性:同时支持 OpenAI Chat Completions、Anthropic Messages 和 Responses API 三种格式,迁移成本低。

相关背景

此前 DeepSeek 以纯文本推理见长,此次 Vision 能力的加入使其在多模态应用场景(如文档处理、界面理解、视觉搜索辅助等)更具竞争力。官方文档提供了完整的代码示例和 cURL 示例,开发者可直接参考接入。