1. 订阅制和 API 计费,是两种完全不同的付费逻辑
大多数人接触 AI 是从网页版订阅开始的:每月付一笔固定费用(比如 ChatGPT Plus),用量在套餐范围内基本不用操心花多少钱。但当你开始用 API——也就是在自己的程序、脚本或第三方工具里直接调用大模型——计费逻辑就变了:不再是包月封顶,而是按实际处理的 token 数量逐次扣费,调用一次算一次的钱,没有月度上限。这带来两个直接后果:一是成本完全跟着用量走,用得少就便宜,用得多可能比订阅贵得多;二是没有"套餐用完自动停"的保护,一段写错的循环代码可能在几分钟内烧掉几十美元。搞清楚 token 怎么计费,是用好 API 的前提。
2. token 到底是什么,怎么换算成文字
token 是大模型处理文本的最小单位,但它既不是"字"也不是"单词"。模型会把文本切成一个个 token,一个 token 可能是一个完整的英文单词、一个词的一部分,或者一个标点。粗略的经验值:英文大约 1 个 token 对应 4 个字符、或 0.75 个单词;中文因为字形信息密度高,通常 1 个汉字要消耗 1 到 2 个 token,比英文更"费"token。这意味着同样一段话,中文的 token 消耗往往高于英文。真正要精确估算时,不能靠肉眼数字数,各家平台都提供了 token 计数工具(tokenizer),把实际文本贴进去就能算出准确的 token 数——批量任务上线前,用真实样本跑一遍计数,比拍脑袋估算靠谱得多。
3. 输入和输出,为什么单价不一样
API 计费最容易被忽略的一点:输入 token 和输出 token 是分开计价的,而且输出通常明显更贵——同一个模型,输出单价可能是输入的三到五倍。原因在于成本结构:输入 token 是模型"读"你发过去的内容(提示词、上下文、历史对话),可以高度并行处理;输出 token 是模型逐个"生成"的,每生成一个都要跑一次完整的前向计算,计算成本更高,于是单价也更高。这条规律对成本优化有直接启发:想省钱,控制输出长度往往比压缩输入更有效——让模型"少说废话、直接给结论",比费力删减提示词更能立竿见影地降本。
4. 上下文越长,为什么每次调用越贵
很多人第一次用 API 会困惑:为什么对话进行到后面,每一轮的花费越来越高?关键在于大模型是"无状态"的——它不会记住上一轮说了什么,每次调用你都得把完整的历史对话重新发一遍作为上下文。也就是说,对话越长,每一轮要重新发送的输入 token 就越多,成本随对话轮次累积上涨。同理,做长文档分析、代码库问答这类任务时,把整篇文档塞进上下文,输入 token 会非常可观。应对办法有几种:只保留最近几轮对话、把长文档先摘要再提问、或用检索的方式只把相关片段送进上下文,而不是每次都发全文。部分平台还提供上下文缓存(prompt caching),对重复发送的相同前缀按更低价计费,长上下文重复调用时值得开启。
5. 怎么估算一个月的 API 成本
API 没有月度封顶,成本要靠自己估。一个可操作的算法:先用真实样本量出单次调用的平均输入 token 和输出 token,分别乘以该模型的输入、输出单价,得到单次成本;再乘以预计的月调用次数,就是月度成本的量级。举例来说,一个每天处理 200 次请求、每次输入约 800 token、输出约 400 token 的应用,一个月就是约 6000 次调用、480 万输入 token、240 万输出 token——把这两个数字分别套进平台价目表,就能得到相对靠谱的预算,而不是等账单出来才发现花超。上线前先按这个方法算一遍,再给自己留 20% 到 30% 的余量应对波动,是比较稳妥的做法。
6. 控制 API 成本的几个实用技巧
在不牺牲效果的前提下,有几条降本手段值得常备:一是按任务选模型,简单的分类、抽取用小模型就够了,别所有请求都调最贵的旗舰模型;二是控制输出长度,用参数限制最大生成 token 数,避免模型长篇大论;三是精简上下文,长对话只保留必要的历史、长文档先摘要或用检索片段代替全文;四是开启上下文缓存,对重复发送的相同前缀能显著降价;五是加一层用量监控和预算告警,很多平台支持设置用量上限或消费告警,把"写错循环烧掉几十美元"这类事故挡在早期。这些技巧叠加起来,往往能把实际账单压到最初估算的一半以下。
7. API 充值这一环,怎么用稳定币或虚拟卡搞定
调用海外大模型 API 的付费方式和订阅制类似,通常需要绑定一张境外信用卡预充值或按月结算。如果你已经在用虚拟卡或稳定币支付 ChatGPT、Midjourney 这些订阅,同一套支付方式可以直接用于 API 平台的充值,不需要单独准备新的支付渠道。稳定币不在对应链上时,可以提前用跨链兑换聚合器换好——AllSwap 无需注册、非托管,选好源链和目标链资产、比价后即可完成兑换,适合在余额告警前把资金准备到位。API 是预充值模式的平台尤其要留意余额,避免用量高峰时因余额不足导致服务中断。
8. 小结
API 按 token 计费是一套和订阅制完全不同的付费逻辑:用多少算多少、没有封顶,输入和输出分开计价且输出更贵,上下文越长每次调用越贵。想控制成本,先用真实样本估算月度预算,再通过选对模型、限制输出、精简上下文、开启缓存和设置用量告警这几条手段综合降本。支付这一环依然可以复用虚拟卡或稳定币这套通用方案。这是本站计费主题连载的最新一篇,后续会继续覆盖更多 AI 服务的计费细节。