很多人第一次充值用中转 API,打开后台一看就懵了:模型列表里写着「模型倍率 2.5」,旁边还有「分组倍率」「补全倍率」,跑了几个请求余额「唰」地往下掉,却完全不知道一次调用到底扣了多少、为什么掉得这么快。这篇文章不卖任何套餐,只把按量计费的底层算法讲透——给你一条通用公式 + 一个完整算例,让你能自己算清单次成本、看懂账单明细,横向比较两家中转贵不贵时心里有数。

先说结论:一次调用扣多少,就这一条公式

主流中转站(new-api / one-api 这类开源计费内核)按量计费时,单次调用的扣费遵循同一个相乘结构:

本次扣费 = 分组倍率 × 模型倍率 × (输入 token 数 + 输出 token 数 × 补全倍率)× 官方基准单价

拆开看,就三个倍率串在一起乘,再乘上「你实际用掉的 token 量」。理解了这条式子,后台所有看不懂的数字都能对上号。下面逐个讲这三种倍率分别是什么、为什么要这么设计。

三种倍率,各管一件事

倍率它在回答什么问题作用对象
模型倍率(Model Ratio)「这个模型本身有多贵?」区分不同模型的基础成本
补全倍率(Completion Ratio)「输出比输入贵几倍?」只放大输出(补全)部分
分组倍率(Group Ratio)「你这个用户分组打几折 / 加几成?」整单乘上去的折扣或加价

模型倍率:模型本身的「贵贱系数」

不同模型成本天差地别——轻量模型一百万 token 可能就一美元出头,旗舰推理模型可能是它的好几倍甚至几十倍。中转站不可能给每个模型单独写一套价格表,于是用「模型倍率」做归一化:以某个基准单价为 1,越贵的模型倍率越高。后台看到某模型「模型倍率 2.5」,意思就是它的基础计费是基准单价的 2.5 倍。同一个模型,在哪家中转、什么分组,模型倍率本身通常是一致的(因为它锚定的是官方真实成本),这也是后面比价的关键。

补全倍率:输入和输出不是一个价

这是新手最容易忽略、却最影响账单的一项。几乎所有大模型,输出(生成)token 都比输入(你发过去的提示)token 贵。这不是中转站坑你,而是官方定价本来就这样——据 OpenAI 与 Anthropic 各自的 API 定价页,多数主力模型输出单价是输入单价的好几倍(常见 5 倍、6 倍这个量级,具体随模型而变)。

补全倍率就是用来表达这个差距的。它只乘在输出 token 上:输入 token 按 1 倍算,输出 token 要先乘补全倍率再参与计费。所以你会发现一个现象——同样消耗一万 token,如果绝大部分是模型生成的长篇回答,扣费会明显高于「你发了一万 token、模型只回一句话」的情况。让模型写大段代码、长文、长翻译时余额掉得快,根子就在补全倍率。

分组倍率:整单的折扣或加价

分组倍率是给「不同用户分组」做差异化定价的总开关,乘在整条式子最外层。它可以小于 1(相当于打折,比如某些高级分组、批量客户)、等于 1(标准价),也可以大于 1(某些高稳定性或专属资源分组加价)。分组倍率 < 1 是省钱,> 1 是加价,记住这个方向就不会看反。很多人「同一个模型换个分组价格就变了」的困惑,答案就在这里。

为什么输入、输出要分开算?再说细一点

把公式里括号那部分单独拎出来:

计费 token 量 = 输入 token + 输出 token × 补全倍率

这里的设计意图是把「贵的输出」单独放大,而不是给输入输出一刀切同一个价。举例理解(纯占位数字):假设某模型补全倍率是 3,你一次调用输入了 1000 token、模型输出了 1000 token,那么参与计费的等效 token 不是 2000,而是 1000 + 1000 × 3 = 4000。同样的 token 总量,输出占比越高、扣得越多。比价时如果只看「模型倍率」不看「补全倍率」,会严重低估真实成本——这是横向比较时最大的坑,后面单独讲。

预扣 vs 后结算:余额为什么先掉一块、又退回来一点

很多人盯着余额会看到一个奇怪现象:请求刚发出去,余额先掉了一截;请求回完,又「回血」了一点点。这不是 bug,而是中转计费内核的双阶段机制,据 new-api 官方文档,它分两步走:

  1. 预扣(Pre-consumption):请求发出时,模型还没开始生成、谁也不知道最终会输出多少 token。系统按一个预估上限先从你余额里扣一笔,相当于「押金」,防止余额不足却已经把算力用掉。
  2. 后结算(Post-consumption):请求真正完成、拿到实际输入 / 输出 token 数后,系统按上面那条公式重新精算一次,再和预扣的押金对比——多扣的退回余额,少扣的补上。

所以正常情况下你看到的「先掉多、后退回」是预扣大于实际的差额返还,属于预期行为。理解这一点有两个好处:一是不会因为瞬间余额骤降就误以为被乱扣;二是知道余额必须留够预扣押金,否则高 token 请求可能因预扣不足而直接被拦下。

一个完整算例:把数字代进去算一遍

下面用一组纯占位数字走完整流程(不是任何真实中转的实际倍率,只为演示算法)。假设:

第一步,算等效计费 token:

2000 + 1000 × 3 = 5000 等效 token

第二步,套三倍率与单价:

本次扣费 = 分组倍率 0.8 × 模型倍率 2.5 × 5000 等效 token × ($1 / 1,000,000)

= 0.8 × 2.5 × 5000 × 0.000001

= $0.01(占位结果)

换算成人民币按你充值时的汇率折算即可。关键不是这个数字本身,而是这套算法的可复现性:同样的输入输出 token,换任何一家中转,只要你知道它的三个倍率和基准单价,就能算出对应扣费——这就是横向比价的基础。

预扣阶段会怎么走?

承接上例,请求发出时系统不知道你只输出 1000 token,可能按「输出顶到模型上限」预估、先扣一笔较大的押金(比如按输出 4000 token 预扣);请求完成后按实际 1000 token 重算成 $0.01,把多预扣的部分退回余额。你在面板上看到的瞬时波动就是这么来的。

怎么去自己后台对照核实

讲完算法,最实用的是教你把它和你自己的账单对上。一个企业化运营、账单透明的中转(这里以 apipifa 为例,开发者接入 Base 地址 https://api.apipifa.com/v1),后台通常能让你查到这几项,逐一对照即可:

能让你「拿日志 token 反推扣费、且对得上」的中转,才是真正可自查的。算不平、或者根本查不到 token 明细的,要打个问号。

怎么判断一家中转贵不贵

知道了公式,比价就不再是看谁吆喝得响,而是把每家折算到同一把尺子上。给你一份对照清单:

该看的项为什么重要
基准单价锚定的是什么有的以「每百万 token $1」为 1 倍,有的锚定别的基准。基准不同,倍率数字没法直接比——必须先统一基准再比。
模型倍率同一模型在两家的模型倍率,折算到同一基准后谁高谁低,是最直接的贵贱信号。
补全倍率(最容易被忽略)只看模型倍率低就下单是陷阱。如果一家模型倍率压得很低、补全倍率却拉得很高,你又是「输出密集型」用法(写代码、长文),实际账单可能反而更贵。
分组倍率与门槛低分组倍率往往绑定充值门槛、稳定性档位或专属资源。看清「低价分组的前提条件」,别被首页最低价误导。
账单能否自查能拿 token 明细反推扣费、且对得上的,通常更可控;查不到 token、对不平账的,再便宜也要谨慎。

一句话总结比价方法:同基准、同模型、同典型用法,把「模型倍率 × 补全倍率折算后的等效单价」算出来比,而不是只比某一个孤立的倍率数字。把你最常用的那个模型、按你真实的输入输出比例代进公式,得到的「等效每百万 token 价格」才是公允的对比口径。

几个常见误区,顺手澄清

把这条公式记住、能在自己后台用真实日志验证一遍,你就从「看不懂、不敢充」变成「算得清、敢横向比」。按量计费的本质并不复杂——三个倍率相乘、输入输出分开算、预扣后结算找平,如此而已。挑中转时,优先选那种倍率公开、账单可自己反推核对的,长期用着才安心,不必为看不懂的扣费提心吊胆。

延伸阅读