技术文章

DeepSeek V4 Flash:API 价格与 Codex 接入核对

核对 Flash 高峰与低谷 API 价格,用可复算示例估算缓存和输出成本,并说明 Codex provider 接入、验证与恢复步骤。

先更新计费口径,再比较任务成本

截至 2026-09-05,DeepSeek 官方价格表区分高峰与低谷、输入缓存命中与未命中。本站旧文的输入 $0.14、输出 $0.28 口径已撤下;历史费用不能用来估算当前请求。本文依据公开文档核对价格和接入条件,没有进行模型效果或速度实测。

价格表中的 deepseek-v4-flash 对应 Flash 0731。模型别名、计费规则和客户端支持可能变动,接入时应保存当天使用的模型 ID、官方价格页和实际账单。参见DeepSeek 官方价格表2026-08-13 发布说明

Flash API 价格与两组可复算示例

每 100 万 Token,美元低谷高峰
输入:缓存未命中0.220.44
输入:缓存命中0.0070.014
输出0.661.32

以上单价来源于官方价格表,读取日期为 2026-09-05。实际适用时段按官方页面及账单确认。

费用 = 未命中输入 / 1,000,000 × 未命中单价
     + 命中输入 / 1,000,000 × 命中单价
     + 输出 / 1,000,000 × 输出单价

假设:1 亿输入 Token,2000 万输出 Token,全部落在同一时段。
无缓存,低谷:100 × 0.22 + 20 × 0.66 = $35.20
无缓存,高峰:100 × 0.44 + 20 × 1.32 = $70.40

假设输入缓存命中率为 80%,输出不变:
低谷:20 × 0.22 + 80 × 0.007 + 20 × 0.66 = $18.16
高峰:20 × 0.44 + 80 × 0.014 + 20 × 1.32 = $36.32

缓存命中率是计算假设,不是实测结果。跨时段请求要分别计费;重试、工具调用后的追加上下文和推理产生的计费输出也要计入。这里没有包含第三方网关加价、税费或运维开销。

Codex 接入:核对 provider、模型和恢复方式

DeepSeek 的官方集成文档通过 Responses API 提供 Codex 配置,列出 deepseek-v4-flashdeepseek-v4-pro 和实验性的 deepseek-v4-flash-vision-exp。它已不限于 Flash;视觉实验模型也不能与普通 Flash 的输入能力混写。参见DeepSeek:Integrate with Codex

  1. 记录已安装客户端版本,备份当前 provider、模型目录和配置文件。配置样例以官方当前页面为准。
  2. 查看设置脚本将写入哪些文件和模型端点,再决定使用脚本或手工配置。不要把 API 密钥提交到仓库。
  3. 启动后核对实际模型和端点,使用公开的小仓库做只读检索,再执行允许的测试命令。
  4. 确认工具调用和结果返回后,才开放一个小范围修改;检查 diff、测试结果和请求账单。
验证任务示例(只读阶段):
读取 package.json,说明测试入口;找到一个纯函数与调用方。
列出所依据的文件位置。不要写文件,不要安装依赖。

修改阶段另行说明:
只修复指定函数;增加一个能复现原问题的用例;运行相关测试。
报告实际执行的命令、结果和未验证事项。

出现认证、模型目录或工具协议错误时,先保存脱敏错误和客户端版本;不要反复切换多个参数后再猜原因。按备份恢复原配置,再单独复现一个变量。本文没有执行带凭据的第三方模型请求。

把公开榜单与自己的工程验证分开

旧文曾引用 Artificial Analysis 的 8 月快照。榜单会随评测版本、推理设置和服务端变化;本站没有保存足以重跑的同环境记录,因此本版不继续用这些数值推导当前排名或速度优势。

如果要判断是否值得替换现有模型,用相同仓库版本、提示、权限、预算和验收条件分别运行。统计完成的任务数、人工修正、失败原因和任务总成本。输出 Token/s 不能直接代替端到端耗时;输出正确也不能证明它遵守了资料边界。

更多方法见模型选型与任务验证;开始接入前,可用任务检查工具记录模型端点、输入范围和回退条件。

来源和本次更新

2026-09-05:更正高峰/低谷计费与两个示例,更新 Codex 模型支持范围,撤下无法按同环境复现的性能比较及过期 FAQ。本文所有费用均为按公开单价计算的示例。