DeepSeek 的 V4 Flash Vision API 有用,但仍处于实验阶段
DeepSeek 已将图像输入加入其快速 API 产品线,但预览版尚未证明它在截图、图表和文档上都能稳定表现。
DeepSeek 通过实验性的 deepseek-v4-flash-vision-exp 模型,为其 API 增加了图像输入。它可以通过熟悉的 JSON、Responses 和兼容 Anthropic 的接口接受截图、图表和文档。这让调用变得容易,但并不意味着它已经可以替代生产视觉路径。
正确的第一步是进行以失败为先的试点:固定一小组无害图像和特定于任务的评分器,发送有界请求,记录 API 实际返回的词元用量和状态,并在实验模型通过明确的质量、可靠性、延迟和成本门槛之前,将现有工作流保留为回退路径。
本文没有调用任何端点,因此没有报告新的成功率、延迟或成本结果。下面的协议旨在产生这些测量结果,同时避免把供应商主张或一次成功演示误认为生产证据。
DeepSeek 发布了什么,还有什么未经证明
DeepSeek 的8 月 21 日 API 更新将 DeepSeek-V4-Flash-Vision-Exp 称为实验模型,并表示其纯文本性能与常规 V4 Flash 相当。公司还表示,其视觉代理能力接近 Claude Opus 4.8。这些是供应商比较,并不是本文独立复现的结果。
SiliconANGLE 报道,该模型可通过 DeepSeek 的付费开发者平台使用,并指出公司尚未披露架构细节。因此,现有证据确立的是一个上线的实验性 API 及其有文档记录的行为,而不是它处理某个特定生产工作负载时的准确性或可靠性。
当前的定价页面列出 100 万词元的上下文窗口和最多 384,000 个输出词元。该模型在 JSON、Responses 和兼容 Anthropic 的 API 中支持 JSON 输出和工具调用。较大的限制是容量上限,并不是合理的试点默认值。应从任务所需的最小输出限制和图像集合开始。
传输方式会改变证据
视觉指南记录了三种发送图像的方式。它们在请求大小、失败模式和可复用性方面各不相同。
| 传输方式 | 文档规定的边界 | 使用时机 | 试点应纳入的失败 |
|---|---|---|---|
| Base64 数据 URL | 每张图像 32 MiB;完整请求体限制为 48 MiB | 图像较小,应在一个请求中传输 | 编码无效、媒体声明错误以及请求体超过限制 |
| 公开图像 URL | URL 最长 8,192 个字符;图像 32 MiB;下载必须在 60 秒内完成 | 来源公开、稳定,并且可安全地让 DeepSeek 抓取 | 链接过期、重定向循环、来源响应慢以及非图像响应 |
Files API file_id | 图像最大 64 MiB;包含文件 ID 时,总请求大小可达 200 MiB | 同一个已批准的构建产物会被重复使用,或图像太大而不适合内联 | 引用缺失、过期、未授权或指向错误文件 |
支持 JPEG、PNG、GIF 和 WebP,服务会检查实际内容,而不是相信文件名。图像应放在用户消息中;将其放在系统消息或助手消息中会产生 400 响应。单个请求最多可以包含 600 张图像,但包含 15 张或更多图像时,单边尺寸限制会从 8,192 像素降至 4,096。试点应测试计划中的生产数量,而不是广告中的最大数量。
对于兼容 Anthropic 的端点,文件引用需要文档规定的 anthropic-beta: files-api-2025-04-14 请求头。在 Responses API 中,同样的 base64、URL 和文件传输方式可通过 input_image 使用。每次运行记录都要保留接口和传输方式;它们是被测试系统的一部分。
图像详细程度会同时改变证据和成本
detail 设置不是装饰性的。low 会将图像缩小到 512×512 像素,这可能让宽阔场景或布局更便宜,但也会抹掉小标签。original 保留源图像;high 目前是它的兼容别名。auto 目前的行为类似 original,因此依赖 auto 会让未来服务端的变化更难被发现。
DeepSeek 表示,它会自动放大小图,并将大图调整到总计大约 800×800 像素,同时保持宽高比。文档规定的上限是每张图像 384 个词元,但实际数量可能变化。应使用每次响应返回的 usage 作为计费记录,而不是根据文件大小或像素尺寸估算。
当前每百万词元的目录价格是:
| 词元类别 | 非高峰 | 高峰 |
|---|---|---|
| 缓存输入 | $0.007 | $0.014 |
| 未缓存输入 | $0.22 | $0.44 |
| 输出 | $0.66 | $1.32 |
当前高峰时段为 UTC 01:00–04:00 和 06:00–10:00。价格可能变化,因此应将价格时间表和证据时间戳与运行记录放在一起。对每次尝试,计算:
attempt cost = cached input × cache rate + uncached input × input rate + output × output rate
应用这些费率时,将词元计数除以 100 万。然后将所有首次尝试和重试的成本除以已接受任务的数量。一个失败于任务的廉价响应,并不是一次廉价的已完成任务。
预览版证明了访问能力,而不是产品就绪度
DeepSeek 暴露了一个有用的实验性界面:开发者可以通过熟悉的 API 发送图像,并观察一个将视觉与文本推理结合的模型。公告和文档没有确立它在截图、图表、文档或对特定产品重要的失败案例上的准确性。
传输方式和图像详细程度设置还会改变模型收到的内容以及请求成本。因此,一次成功演示可能反映的是简单图像、宽松的预处理或狭窄的输出,而不是通常可靠的视觉系统。
最重要的未决证据,是针对预览版本迭代进行独立的、任务级评估。在此之前,最好把 DeepSeek V4 Flash Vision Exp 理解为一种发展方向:多模态能力正进入快速 API 产品线,但“实验性”标签仍然描述着它的可靠性契约。