Gemini API 成本估算:token、模型与快取
大模型怎么调最省钱?按百万 Token 详细算账,解析长文本重复提问利用 Context Caching(上下文缓存)直降 75% 成本的黑科技。
一、Gemini 官方极具杀伤力的价格优势
Gemini 1.5 系列在全球主流商业大模型中以极高的性价比著称:
- 1.5 Flash:百万输入 Token 仅约 0.075 美元,百万输出仅约 0.3 美元;
- 1.5 Pro:主打百万级超大上下文深度分析,提供工业级推理质量。
二、利用 Context Caching 削减 75% 开销
在构建专业知识库问答或分析一本固定的超大操作手册(超过 10 万字)时:
以往每次提问都必须全量重传这本长手册,产生高额的重复输入计算费。
借助官方 Context Caching 技术,可将该底稿在谷歌云端建立持久预编译缓存:
后续的所有提问只需引用该 Cache 句柄,输入成本立减 75% 以上,且响应速度呈数倍飙升!
三、用量监控配置
随时关注控制台用量大盘,详见:[在 AI Studio 查看专案用量与配额](https://aihuiyuan.club/articles/google-ai-studio-quota-usage-dashboard-monitoring-guide)。