实际使用与边界
适用场景:导出有代表性的请求 Usage,分类记录输入、缓存输入、输出、重试和工具,再把 p50 与 p95 单位成本同供应商 Costs 数据比较,之后再设置生产预算。
边界:供应商模型、Token 统计、价格、层级、缓存规则、账单货币和折扣都会变化。计算器只是规划模型,不是报价,也不能替代最终账单。
先算单位成本,不要直接猜月费#
有用的成本预测应从一个完整工作单元开始,例如一次客服回答、文档抽取、编程任务、搜索回答或智能体运行。记录这个单元的输入 Token、其中命中缓存的部分、输出 Token、模型和服务层级。把每类 Token 乘以当前每百万 Token 单价,再加入单独计费功能,就能得到可与流量相乘的单次请求成本。如果只从一个整数月度预算开始,而没有单位成本,出现超支时就很难解释原因,也无法公平比较两种架构。
使用三部分 Token 公式#
对基础文本请求,可变成本等于:非缓存输入 Token 除以一百万乘输入单价,加缓存输入 Token 除以一百万乘缓存输入单价,再加输出 Token 除以一百万乘输出单价。计算过程先保留供应商账单货币,最后才用明确汇率假设做规划折算。本站 LLM API 成本计算器不内置模型价格,因为模型名称、费率、服务层级、长上下文规则和促销都可能变化。
实测 Token,不要只按字符估算#
Token 化会随模型、语言、结构化数据、图片、音频、工具定义和对话历史变化。字数到 Token 的换算适合草图,却不应直接批准生产预算。应使用供应商计数接口、tokenizer、响应 usage 字段或组织级 Usage 导出。计数对象要包含完整请求,包括系统指令、检索段落、Schema 和历史消息,以及完整输出。usage 中还可能出现推理或思考 Token,其计费与报告方式取决于具体模型规则。
建立分布,不要只测一个平均提示词#
收集有代表性的测试集,至少报告输入、输出、延迟和重试的中位数与高分位数。用户消息长度不同,检索结果文档量会变化,智能体可能多次调用工具,安全或格式重试也会生成额外完成。应按请求类别的加权组合计算流量,而不是把所有工作流压成一个平均值。p50 描述常见情况,p95 与流量尖峰情景则揭示长请求或重复工作出现时需要的预算。
把缓存建模为实测命中率#
提示词缓存可以降低符合条件的重复输入价格,但有折扣不等于所有看似重复的提示词都会命中。供应商会采用可能变化的模型、前缀、最低 Token、持续时间、路由与存储规则。应把稳定指令与复用上下文组织成一致前缀,再从响应或 Usage 导出读取缓存 Token。预测时输入实测缓存比例,并保留零缓存情景;供应商如果列出缓存写入或存储费用,也应一并计入。
补上 Token 公式没有覆盖的成本#
简单公式可能不包含网页搜索、代码执行、文件检索、Embedding、向量存储、图片或音频 Token、缓存存储、批处理或优先层级、地区处理、专用容量、税费和换汇。即使用户没有得到有用答案,重试和失败请求也可能消耗可计费资源。把每个非 Token 项目按计费单位、费率和证据来源列在基础估算旁,避免某个供应商专属功能悄悄污染核心模型比较。
把流量转成月度预算#
月度可变成本等于单次请求成本乘以每个活跃日的成功与失败尝试次数。再加入固定平台成本,与预算和明确安全余量比较。至少测试流量减半、预期流量和翻倍三种情景。需求不确定时,应在模型之外设置项目硬预算、速率限制、最大输出 Token、任务超时和告警。只有应用能够在失控账单前降级、排队、切换模型或停止,预算才真正有效。
对齐预测、Usage 与账单#
小范围上线后,按项目、模型、端点、服务层级和日期汇总 Usage。先把请求数与 Token 类别同应用追踪对齐,再把供应商成本数据与账单比较。OpenAI Usage 文档提示 Usage 视图与成本数据可能有小幅差异,并建议财务对账采用 Costs 数据或账单控制台。为每个差异记录原因,例如额度、缓存 Token、批处理价格、工具费、失败调用、税费、四舍五入或缺少项目标签,再更新预测版本。
优化最大成本来源,而不是盲目降质#
先识别最大驱动来自输入、输出、重试、工具还是流量。只有验证回答质量后才缩短重复上下文;通过稳定的合格前缀提高缓存复用;任务有自然停止点时限制输出;把简单工作路由到合适的低成本模型;供应商支持时把可延迟任务放进批处理;并通过校验输入与 Schema 减少重试。每次改动后重新运行固定评测集。一次请求即使更便宜,如果无法完成任务、增加人工修复或扩大安全风险,也没有价值。
常见问题
发送请求前如何知道 Token 数量?
使用供应商针对准确模型和请求格式提供的 tokenizer 或计数接口。生产预测还应记录完成响应返回的 usage,因为工具定义、检索上下文和生成输出都会影响最终数量。
是否需要计入推理 Token?
供应商报告或计费时就需要计入。不同模型处理方式不同,应核对当前官方价格与 Usage Schema,不要假定它免费或与可见输出完全相同。
提示词缓存能保证账单下降吗?
不能。节省取决于缓存资格、前缀稳定性、真实命中率、缓存输入价格,以及可能存在的写入或存储费用。应把实测缓存情景与零缓存备用情景比较。
为什么账单可能与计算器不同?
计算器只模拟输入的 Token 费率、请求量和一项固定成本。工具、存储、多模态用量、服务层级、重试、额度、税费、四舍五入和合同条款都可能改变账单。