$0.045-$0.09 per image。把鼠标悬停在价格上会显示 tooltip,说明具体规则(例如不同分辨率或选项对价格的影响)。
对于绝大多数模型,单次请求的价格在提交时即已确定:价格由你的请求参数计算得出,模型运行前就已锁定,账单流水 中的扣费就是这个金额。相同参数的请求价格永远相同,可以精确预算。少数模型(例如按输出秒数计费的视频模型)在完成后按实际用量结算,其 tooltip 中会注明。
Pricing API
价格可以通过 API 编程读取——既有人读字符串,也有机器可读的规则。价格列表的翻页
GET /v1/pricing 返回列表信封 —— { "object": "list", "data": [...], "has_more": … },支持这些参数:
一直往后翻,直到
has_more 为 false:
starting_after 如果不是本端点返回过的某一行的 id,会返回 400 —— 它绝不会被当作”从头开始”。不支持 ending_before,请只往前翻。如果只想一次拿到完整目录,直接给一个足够大的 limit 也可以。
要在发送请求前精确计算价格,先查模型 id:
价格规则如何生效
prices 数组自上而下与请求参数逐行匹配,第一条 matches 条件全部成立的行决定价格。没有 matches 的行恒成立——即兜底价。
条件与请求参数的比较方式:
请求中未传的参数不会匹配任何条件——匹配前不会填充默认值。价格表的行序已按此设计:省略可选参数会落到其默认行为对应的行。
以上表为例:
{"images": [a], "resolution": "1K"}→ 第一行 → $0.045{"images": [a, b, c], "resolution": "1K"}→ 1K 且$size: 3的行 → $0.053{"images": [a]}(省略 resolution,模型默认 2K)→ 跳过 1K 各行,命中$size_lte: 1→ $0.09
usage_key,则金额为 unit_amount × 该参数的值(例如按请求时长每秒计价)。
LLM 按 token 计费
LLM 模型(chat、messages、responses)按 token 计费,而不是按请求计费。费率列在 sunra.ai/models 各模型价格页,也可通过GET /v1/pricing/model/{model_id}/endpoint/llm 以程序方式读取。
模型的费率表为每个 token 桶各配一个费率。常见的桶有:
Cache read 按 cache read 费率计费,并从 input 桶中扣除,因此一个缓存令牌只收一次费,且按较低的费率。
deepseek-v4-flash 的 cache read 费率是每 100 万令牌 $0.0028,而输入费率是 $0.14——便宜 50 倍;deepseek-v4-pro 则是 $0.003625 对 $0.435。费率表中没有 cache read 费率的模型,其缓存令牌按输入费率计费。
您无需传任何参数来启用它——命中如何回报给您,见提示缓存命中。
一次提示为 98,695 令牌、其中 96,128 令牌由缓存提供的请求,会结算成三行,且 input 行只计入未命中缓存的 2,567 令牌:
与大多数多模态 endpoint 不同,LLM 请求无法在运行前定价——令牌数要等模型作答后才知道。提交时会按对您提示的保守估计预留额度,请求完成后按实际用量结算,差额释放。您的账单历史显示的是结算后的金额。
提前结束的流式请求按实际投递给您的输出计费,失败的请求完全不计费——见输出上限与流生命周期。