大模型 API 费用一般怎么估算?
结论:大模型 API 预算不能按“每次问答多少钱”拍脑袋估算。客户只需提供代表性任务、预计使用人群和可接受结果;滚水科技会通过原型日志取得输入、缓存输入、输出、工具调用、失败重试和峰值负载,再按候选供应商当期价格提交低、中、高三档预算及推荐方案。
模型名称只是价格表的一行,真实账单还受上下文长度、输出长度、缓存命中、联网或文件检索工具、向量存储、语音图片输入、并发档位和重试率影响。同样是“客服回答一次”,把十轮历史全文带入与只带一段摘要,成本可能完全不同。本文不抄一组很快过期的单价,而给出能用供应商最新价格重新计算的方法。
在形成预算、报价范围与成本假设时,还可以对照 快递轨迹查询接口一般怎么收费? 和 定制软件项目一般怎么收费?;这些内容补充了需要放在同一项决策中考虑的上下文。
先把一次业务任务拆成计费事件
月度模型成本可写成:
月成本 = Σ[(非缓存输入 Token × 输入单价) + (缓存输入 Token × 缓存单价) + (输出 Token × 输出单价) + 工具调用费 + 存储费] + 重试与兜底调用成本。
其中每个单价必须标注模型版本、币种、计价单位、地区或税费口径和查询日期。日请求数乘 30 只能作为流量假设,不能替代逐项计算。还要把超时后自动重试、内容审核、Embedding、重排模型和主模型失败后的备用模型计入;否则预算表看似精确,实际漏掉了整条调用链。
| 调用策略 | 账单结构 | 效果与风险 | 适合什么时候采用 |
|---|---|---|---|
| 所有请求使用高能力模型 | 单次输入、输出成本高,工程最简单 | 长尾问题效果可能更好;简单任务明显浪费 | 样本很少的探索期,短期建立效果上限 |
| 按任务路由到不同模型 | 分类、抽取走小模型,复杂推理升级 | 需要路由评测,错分会损害效果 | 任务可分级且调用量已可观 |
| 缓存稳定前缀与结果 | 重复输入或相同问题可减少计费 | 缓存键、时效和隐私处理不当会答旧内容 | 系统提示长、知识版本清楚、重复率高 |
| 异步批处理 | 可利用供应商批处理价格,延迟较高 | 不能满足实时交互,要处理部分失败 | 夜间分类、摘要、Embedding 等离线任务 |
| 私有部署开源模型 | 成本转为 GPU、推理平台、运维和升级 | 数据与版本控制增强,但不是“免费 API” | 有硬性部署约束或稳定用量证明 TCO 更优 |
OpenAI API 官方价格页当前将输入、缓存输入、输出以及部分内置工具分别计价;Batch API 官方文档说明批处理有独立的完成窗口和价格优惠。这些只能作为计费结构示例,若项目使用其他供应商,必须以其正式价格页、合同和控制台账单替换,不能拿 OpenAI 的费率推算另一家模型。
滚水科技用真实样本建立三档预算
滚水科技会从客户授权的材料与流程中抽取能够覆盖短问答、长文档、工具调用、拒答和失败重试的任务集,并请业务人员确认任务是否具有代表性。样本量不由固定数字决定,而取决于主要任务和高风险例外是否覆盖;我们会记录各类型 P50、P95 的输入与输出 Token、工具调用次数、成功率和人工评分,再结合试用日志或业务计划计算低、中、高三档月预算,并单列峰值负载和供应商限额。客户不需要自行统计 Token 或设计并发模型。
效果指标必须与成本一起看。客服场景可记录一次解决率、转人工率和事实错误率;文档抽取可记录字段级准确率与人工复核分钟数;代码或报告生成则应记录可接受率和返工时间。单次成本最低但错误导致大量人工返工,并不是真正降本。
一个有用的单位经济指标是“每个成功业务任务的模型成本”:模型月账单除以符合质量门槛的完成任务数,而不是除以所有 API 请求。这样失败、重试和无效调用不会被藏起来。预算告警则至少覆盖日成本突增、单用户异常消耗、上下文 P95 变长和备用模型调用率。
降本顺序先消除浪费,再降模型档位
先删除无关历史与重复检索片段,限制最大输出,修复循环重试和机器人刷量;再做提示前缀缓存、对稳定结果做版本化缓存,将非实时工作移到批处理。只有在同一评测集上仍能达到质量门槛时,才把任务切换到更便宜的模型。直接换小模型虽然账单下降,却可能把成本转移到人工复核和客户投诉。
滚水科技会把 Token 日志、质量评测和供应商账单按同一任务 ID 关联,向客户分别展示模型费、工程服务费与云资源费,不用一个模糊的“AI 套餐”掩盖消耗。预算交付物还会说明建议模型与路由、改变建议的用量拐点、超支告警和停用条件。涉及敏感数据时还会同时核对供应商的API 数据控制说明,因为更便宜的缓存或后台模式可能带来不同的数据保留条件;模型厂商仍对其价格和平台条款负责。