计费示例

典型 LLM、视频、图像和音频模型的定价计算示例——LLM token 计费、按 token 计费的视频、按秒计费的视频、按张计费的图像、按 token 计费的图像,以及按字符计费的音频

本页通过几个典型模型演示真实的计费计算,每种定价方式各举一例。每种定价方式背后的机制详见模型如何计费

所示费率为撰写时的快照

以下费率均为标价,在撰写本文时(2026 年 7 月)准确无误,之后可能变化。任何平台或账户折扣都会在此基础上自动应用。模型详情页和费用预估 API 始终返回当前的权威价格。

LLM token 计费——zai-org/glm-5.2

LLM 模型按百万 token 计费,输入(提示词)、缓存输入和输出(补全)token 分别有各自的费率(参阅 LLM 模型):

token 类型标价
输入 token每百万 $1.40
缓存输入 token每百万 $0.26
输出 token每百万 $4.40

Cost=Fresh Input1M×$1.40+Cached Input1M×$0.26+Output1M×$4.40Cost = \frac{Fresh\ Input}{1M} \times \$1.40 + \frac{Cached\ Input}{1M} \times \$0.26 + \frac{Output}{1M} \times \$4.40

费用在请求完成后扣除,依据响应 usage 字段中报告的 token 数量——流式和非流式请求的计费方式完全相同,失败的请求不会计费。

示例——一次包含 12,000 个提示词 token(其中 10,000 个命中提示词缓存)和 1,500 个输出 token 的聊天请求:

  1. 新输入:2,000 × 1.40÷1M=1.40 ÷ 1M = 0.0028
  2. 缓存输入:10,000 × 0.26÷1M=0.26 ÷ 1M = 0.0026
  3. 输出:1,500 × 4.40÷1M=4.40 ÷ 1M = 0.0066
  4. 合计:$0.0120

如果没有提示词缓存,同一请求的全部 12,000 个输入 token 都会按完整输入费率计费——0.0168+0.0168 + 0.0066 = $0.0234,几乎是前者的两倍。在多次请求间保持系统提示词稳定,可以让重复部分享受缓存费率。

按 token 计费的视频——bytedance/seedance-2.0/reference-to-video

Seedance 2.0 参考生视频在任务完成时按输出视频 token 计费(参阅按 token 计费的视频模型)。根据你的输入类型,适用两种 token 费率:

输入类型token 费率
仅参考图像(无视频输入)每百万视频 token $11.20
包含参考视频每百万视频 token $6.88

分辨率乘数:480p / 720p / 1080p × 1.0,4k × 0.57,720p-sr / 1080p-sr × 1.8,1440p-sr × 3.2。计费 token 按实际生成的输出计量(对包含参考视频的请求,还会计入输入视频的贡献),因此 4K 和 SR 档位请使用 /calculate 获取精确报价。

Token 数量随分辨率、帧率和时长增长:

Video TokensWidth×Height×FPS×Duration(seconds)1024Video\ Tokens \approx \frac{Width \times Height \times FPS \times Duration(seconds)}{1024}

在 1080p(1920 × 1080,24 fps)下,相当于每秒视频 48,600 token

示例 A——仅参考图像,1080p 下 10 秒:

  1. 输出 token:48,600 × 10s = 486,000 token
  2. 标价:486,000 ÷ 1,000,000 × 11.20×1.0=11.20 × 1.0 = **5.44**

示例 B——包含一段 8 秒参考视频,1080p 下输出 10 秒:

  1. 计费 token 包含输入视频和输出:(10s + 8s) × 48,600 = 874,800 token
  2. 适用更低的含视频费率:874,800 ÷ 1,000,000 × 6.88×1.0=6.88 × 1.0 = **6.02**

提交时会临时冻结一小笔金额,任务计费后立即释放;失败的任务不会计费。

按秒计费的视频——alibaba/wan-2.7/image-to-video

Wan 2.7 图生视频采用经典的按秒定价:基础费率为每秒 $0.10,按输出分辨率缩放,并设有 5 秒最低计费时长

分辨率实际费率
720p$0.10 / 秒
1080p$0.15 / 秒
1080p-SR(从 720p 放大)$0.12 / 秒
1440p-SR(从 720p 放大)$0.2133 / 秒

Cost=$0.10×max(5, Duration)×Resolution MultiplierCost = \$0.10 \times max(5,\ Duration) \times Resolution\ Multiplier

示例——1080p 下 8 秒:

0.10×8×1.5=0.10 × 8 × 1.5 = **1.20**,提交时从你的余额中预留,视频交付后正式扣除。

示例——720p 下 3 秒:

时长低于最低计费时长,因此按 5 秒计费:0.10×5×1.0=0.10 × 5 × 1.0 = **0.50**。

按张计费(含选项)的图像——google/nano-banana-pro/edit

Nano Banana Pro(编辑变体)按输出图像张数定价,含分辨率档位和可选的联网搜索附加费:

项目标价
最高 2K 的图像$0.14 / 张
4K 图像$0.24 / 张
联网搜索(可选)$0.014 / 请求

Cost=Images×Tier Price (+ $0.014 if web search)Cost = Images \times Tier\ Price\ (+\ \$0.014\ if\ web\ search)

示例——2 张 4K 图像,开启联网搜索:

  1. 图像:2 × 0.24=0.24 = 0.48
  2. 联网搜索:+ $0.014(每次请求只加收一次)
  3. 标价合计:$0.494

金额在提交时预留,任务失败时自动释放。

按 token 计费的图像——openai/gpt-image-2/edit

GPT Image 2 像 LLM 一样按 token 计费,但 token 数量在提交时根据你的请求参数计算:

token 类型费率计数方式
输出图像 token每百万 $30根据输出的 sizequality
输入图像 token每百万 $8根据每张输入图像的实际尺寸
输入文本 token每百万 $5每张生成图像固定 1,000 token

1024×1024 图像的输出 token 数:196low)、1,756medium)、7,024high)。更大的尺寸产生成比例更多的 token;输入图像始终按 medium token 基数计算,与 quality 无关。

示例——编辑一张 1024×1024 图像,quality: mediumsize: 1024x1024n: 1

  1. 输入文本:1,000 token × 5/1M=5/1M = 0.0050
  2. 输入图像:1,756 token × 8/1M=8/1M = 0.0140
  3. 输出图像:1,756 token × 30/1M=30/1M = 0.0527
  4. 合计:每张图像 ≈ $0.072

请求 n 张图像时,总金额会乘以 n

按字符计费的音频(TTS)——xai/tts-v1bytedance/seed-audio-1.0

这两个文本转语音模型均按输入文本的长度定价,费率为每 1,000 字符 $0.015

Cost=Characters(text)1,000×$0.015Cost = \frac{Characters(text)}{1{,}000} \times \$0.015

字符按 Unicode 字符计数,因此一个 CJK 字符与一个拉丁字母一样,都算作一个字符。

示例——一段 1,200 字符的脚本:

1,200 ÷ 1,000 × 0.015=0.015 = **0.018**,提交时扣费。

示例——一段 300 字符的短提示词:

300 ÷ 1,000 × 0.015=0.015 = **0.0045**。

自行核算任何模型

以上每个示例都可以通过费用预估 API 复现——将你的确切请求体发送到 /api/v1/model/calculate,即可在不创建任务的情况下获得标价、你的实际生效价格和所应用的折扣。