Gemini API 计算输入 token:呼叫前估算方法
在向接口发送请求前先算清花了多少钱!使用官方 model.count_tokens() 接口精算长文本与多模态图片消耗实操。
一、为什么在调用前必须先计算 Token
在处理海量文档或自动化数据批处理时,如果盲目向顶级模型发起请求,一旦输入文档体积远超预期,不仅可能瞬间触发 TPM 限流报错,还会产生意外的预算消耗。
官方提供了极速且完全免费的 countTokens 预计算接口。
二、Python SDK 原生极简估算代码
import google.generativeai as genai
model = genai.GenerativeModel("gemini-1.5-flash")
text_content = "这里是长达数万字的技术文档或者即将输入的书籍章节..."
# 纯粹计算 Token 数量,不消耗推理费用,不计入 RPM 阈值
token_count = model.count_tokens(text_content)
print(f"当前输入预计消耗 Token 总数: {token_count.total_tokens}")
三、根据结果动态调度模型
在代码中编写分支判断:若 total_tokens < 30000 选用常规处理;若超过 10 万 Token 则自动调用 Context Caching 机制。
成本核算参考:[Gemini API 成本精算与缓存技术](https://aihuiyuan.club/articles/gemini-api-cost-estimation-tokens-models-context-caching)。