按 token 实际用量计费,失败请求的处理规则。
对话类模型按输入 + 输出 token 计费,价格以「模型广场」上各模型的标价为准。 缓存命中、思考(reasoning)token、音频与图片会按各自单价单独计算,账单里逐项列出。
请求发起时会先冻结一笔保守估算的额度,调用结束后按真实用量结算, 多冻结的部分立即退回。所以你可能短暂看到余额比预期低一点,这是正常的。
判据是"上游有没有真的消耗算力",而不是最终有没有返回成功。
控制台「计费流水」页有逐笔记录,含模型、用量、原价、折扣与实付。