多模态 Agent 入门
什么是多模态 Agent
传统 Agent 只能处理文本输入。多模态 Agent 扩展了感知范围——能理解图片、图表、文档扫描件、甚至音视频。这在医疗影像分析、工业质检、图纸问答等场景至关重要。
三种实现路径
1. 多模态 LLM 原生支持
GPT-4V、Claude 3 Vision、Qwen-VL 等模型原生支持图片输入。最简单——直接把图片作为消息的一部分传入,LLM 自动理解并作出反应。
// OpenAI API 多模态消息
{
"role": "user",
"content": [
{ "type": "text", "text": "这张 X 光片有什么异常?" },
{ "type": "image_url", "image_url": { "url": "..." } }
]
}
优点:开发成本低、视觉理解能力强
缺点:Token 消耗大(每张图 ≈ 数百至上千 Token)、延迟高
2. 视觉工具调用 (Tool-based Vision)
Agent 将图片处理交给专用工具——OCR 提取文字、图像描述模型生成文本摘要、目标检测模型标注区域。LLM 只处理文字。
用户: "这个发票的总金额是多少?"
Agent 思考: 需要 OCR 提取文字
→ 调用 ocr_extract(image_path) → "金额: ¥12,800"
→ 推理: 总金额是 12,800 元
→ 回复用户
优点:Token 消耗低、延迟可接受、工具可替换
缺点:信息在工具转换中有损失
3. 混合策略
先用轻量视觉工具做预筛选,复杂场景再走多模态 LLM 深度分析。平衡成本与效果的最佳实践。
实践场景
- 文档问答:PDF/扫描件 → OCR → 文本检索 → RAG 回答
- 图表分析:截图 → 图表描述模型 → 结构化数据 → 推理分析
- 视觉导航:UI 截图 → 元素定位 → 操作决策 → 点击执行
- 图纸审查:CAD 图 → 区域标注 → 规则检查 → 报告生成
推荐策略
起步阶段用路径 2(工具调用),成本可控、效果明确。当场景需要在图片中做复杂推理(空间关系、表情理解、图表判断)时,升级到路径 3(混合)或路径 1(原生)。关键指标:图片处理耗时 < LLM 推理耗时才值得引入。