多模态视觉代码实战:单次上传多张图片并进行跨图比对与表格提取
怎么让 AI 一眼看懂几张对比图?手把手教你用 Python 加载本地 PIL 图片数组,让 Gemini 1.5 跨图提取差异并直接输出 Markdown 表格。
一、多模态图文混排的天然支持
Gemini 原生就是原生多模态架构,不需要外挂任何图片转换器。
二、两张图找茬与参数对比实战代码
import PIL.Image
img1 = PIL.Image.open("product_v1.png")
img2 = PIL.Image.open("product_v2.png")
prompt = "对比这两张产品原型图的设计差异,并以 Markdown 表格形式列出新增与废弃的交互组件。"
response = model.generate_content([prompt, img1, img2])
print(response.text)
仅需将文本提示词与 PIL 图片对象直接放入同一个 Python 列表中,模型便能展现惊人的像素级跨图比对洞察力。