AI AI Club
← 返回文章列表

Gemini 串流输出怎么实作

拒绝等待漫长生成!手把手教你编写 generate_content(stream=True) 流式代码,实时消费异步数据流打造打字机动画。

一、为什么流式输出至关重要

如果采用传统的非流式调用,当要求模型撰写一篇数千字的长篇分析时,用户必须对着空白屏幕死等 5~10 秒直到整篇文章生成完毕。
开启流式输出后,首字延迟(TTFT)缩短至几百毫秒,体验极为顺畅。

二、Python 极简流式输出实现

import google.generativeai as genai
model = genai.GenerativeModel("gemini-1.5-flash")

# 开启 stream=True 参数
response = model.generate_content("请写一篇探讨人工智能未来的短文", stream=True)

for chunk in response:
# 逐块输出并强制刷新缓冲区
print(chunk.text, end="", flush=True)

三、前端 Web 转发注意

如果在 Next.js 或 FastAPI 等后端作为中间件转发,需采用 Server-Sent Events(SSE)协议将 chunk 推送给前端浏览器。
基础配置参考:[Gemini API 入门总指南](https://aihuiyuan.club/articles/gemini-api-key-google-ai-studio-free)。

联系我们

会员开通、订单问题或合作咨询,欢迎联系。

QQ1192214187
邮箱winky20000401@gmail.com