AI AI Club
← 返回文章列表

Gemini API 计算输入 token:呼叫前估算方法

在向接口发送请求前先算清花了多少钱!使用官方 model.count_tokens() 接口精算长文本与多模态图片消耗实操。

一、为什么在调用前必须先计算 Token

在处理海量文档或自动化数据批处理时,如果盲目向顶级模型发起请求,一旦输入文档体积远超预期,不仅可能瞬间触发 TPM 限流报错,还会产生意外的预算消耗。
官方提供了极速且完全免费的 countTokens 预计算接口。

二、Python SDK 原生极简估算代码

import google.generativeai as genai
model = genai.GenerativeModel("gemini-1.5-flash")

text_content = "这里是长达数万字的技术文档或者即将输入的书籍章节..."

# 纯粹计算 Token 数量,不消耗推理费用,不计入 RPM 阈值
token_count = model.count_tokens(text_content)
print(f"当前输入预计消耗 Token 总数: {token_count.total_tokens}")

三、根据结果动态调度模型

在代码中编写分支判断:若 total_tokens < 30000 选用常规处理;若超过 10 万 Token 则自动调用 Context Caching 机制。
成本核算参考:[Gemini API 成本精算与缓存技术](https://aihuiyuan.club/articles/gemini-api-cost-estimation-tokens-models-context-caching)。

联系我们

会员开通、订单问题或合作咨询,欢迎联系。

QQ1192214187
邮箱winky20000401@gmail.com