普通输入
模型需要读的内容你的问题、系统指令、历史对话、文档和工具结果,都可能构成输入。
“每亿”只是方便比较的展示单位,并不表示必须购买一亿 Token,也不等于一次请求的容量。
01 / 计量
它可能是一个字、一个词,也可能只是词的一部分。不要把 Token 数直接当成汉字数或英文单词数:语言、文本内容和模型的分词器都会影响结果。
02 / 拆账
缓存也有条件:有效期、最小长度、复用方式和命中规则因平台而异;某些服务另收存储等费用。不能把所有重复输入都假定为命中。
你的问题、系统指令、历史对话、文档和工具结果,都可能构成输入。
符合厂商缓存条件的输入可按缓存读取价计费。命中量是输入的一部分,不能重复计费。
回答及部分模型的推理用量可能产生费用;以该模型的计费定义为准。
未命中输入量 × 输入单价
+ 命中输入量 × 缓存读取单价
+ 输出量 × 输出单价
03 / 用真实报价计算
选一条当前可调用的报价,填写每月请求量和每次 Token 数。这里用主站的同一份价格资料和汇率,展示输入、缓存读取与输出如何组成费用。
相对零缓存节省 ¥152.71
仅计算输入、缓存读取和输出;缓存写入、存储、工具与税费未计入。单次请求应符合所选档位。
此模型每 1 亿 Token 价格 · CNY
04 / 读懂价格条件
同一模型也可能有不同平台、地区、上下文长度或服务档位。每一行价格是一条有条件的报价,而不是这个模型永远不变的单价。
长上下文阈值通常按单次请求的输入长度判断,不是按月累计用量。超过阈值时,部分厂商对整次请求应用高档价格。
缓存命中属于输入用量的一部分。缓存写入、有效期、最短长度、存储费与读取折扣各有规则。
工具调用、搜索、批量折扣、地区加价、税费与不同模态可能另计。历史价格不可当成当前可购买价格。
05 / 常见问题
先选满足任务要求的模型,再比较真实工作量下的费用。
如果后续请求再次包含历史内容,它会再次构成输入。不能只按刚输入的那一句估算;缓存折扣也需要满足平台条件。
不一样。上下文容量约束一次请求可处理的内容;月用量是多次请求累计。长上下文档位应按单次请求规则选择。
文档输入、工具循环、重试和计费范围内的推理用量都可能增加消耗。先核对响应中的用量明细,再看官方价格规则。
不是。空白表示本站没有对应价格;零元才表示记录的价格为零。缺少必要价格时,无法得出完整费用。
不能默认包含。聊天产品会员、Coding Plan 和按量 API 是不同产品,需要分别检查额度、限制及超额规则。
保持任务、输入输出用量和计费渠道一致,并查看地区、价格档位、附加费及核查日期。便宜的 Token 不一定意味着完成同一任务更便宜。