← 全部工具
AI 工程成本工具

LLM API 成本计算器

把一次请求拆成非缓存输入、缓存输入和输出 Token,再用真实流量与预算检查原型能否负担得起。

TOKEN 成本模型使用供应商当前报价,而不是内置价格表
示例工作负载
结果显示货币

价格、汇率与 Token 数量均为用户输入的规划假设。工具不会读取 API 密钥、发送请求或上传输入。

预计月度总成本¥761.25

15,000 次请求 · ¥0.05075 / 请求 · ¥0.00 固定成本

每千次请求¥50.75
缓存节省估算¥78.75
预算使用率21.8%
单次请求成本结构输入、缓存与输出分开计价
非缓存输入¥0.02141.4%
缓存输入¥0.001753.4%
输出¥0.02855.2%
预算容量68,965 次请求

按当前单次成本与固定成本,月度预算可承载的近似请求量。超额、工具调用、图片、音频、搜索、存储和税费需另算。

流量敏感度请求量减半、当前与翻倍
50%¥380.637,500 次/月
100%¥761.2515,000 次/月
200%¥1,522.5030,000 次/月

公式与计算边界

单次可变成本=非缓存输入 Token÷1,000,000×输入单价+缓存输入 Token÷1,000,000×缓存单价+输出 Token÷1,000,000×输出单价。月度总成本再乘以请求量并加上固定成本。由于供应商价格会变化,所有单价均由用户填写。

带数字的示例

默认每次输入 2,000 Token、输出 500 Token、25% 输入命中缓存,三个单价分别为每百万 Token 2、0.5 和 8 美元,单次成本为 0.00725 美元。每天 500 次、每月 30 天,对应月度可变成本 108.75 美元,尚未包含固定成本、工具、存储、税费或超额费用。

采取行动前检查

  • 从供应商官方页面复制准确模型、服务层级、地区、上下文长度与缓存模式的当前单价。
  • 使用接近生产环境的追踪记录测量 p50 和 p95 Token,而不是只测试一个手写提示词。
  • 用供应商 Usage 与账单数据校准预测,并为重试、失败、工具、多模态输入和流量尖峰留出预算。

常见问题

计算器能把文本自动转换成 Token 吗?

不能。Token 化因模型和模态而异,应使用供应商 tokenizer、计数接口或响应中的 usage 字段,再把实测数值填入。

为什么输入和输出要分开计价?

供应商通常分别公布输入、缓存输入和输出价格。输出或推理 Token 可能明显更贵,使用一个混合价格会掩盖主要成本来源。

缓存比例能保证节省这些费用吗?

不能。是否符合缓存条件和真实命中率取决于供应商规则与稳定的提示词前缀。这里展示的是需要用 usage 数据核对的敏感度情景。

计算结果会与最终账单完全一致吗?

未必。工具调用、搜索、图片、音频、存储、批处理层级、长上下文、税费、额度和合同条款都可能另行计费。

上线前建立可测量的 LLM 成本预算 ↗

为什么不内置模型价格

模型名称、计费层级、长上下文、批处理、缓存、工具调用和地区规则会变化。内置价格表很快就可能误导用户,所以本工具要求从供应商当前官方页面填写单价,并把保存的账单或 Usage 数据作为上线后的真实校准依据。

完整方法:上线前如何估算 LLM API 成本。

官方核对入口