多模态 Agent 入门

2026-06-09多模态AgentVision架构

什么是多模态 Agent

传统 Agent 只能处理文本输入。多模态 Agent 扩展了感知范围——能理解图片、图表、文档扫描件、甚至音视频。这在医疗影像分析、工业质检、图纸问答等场景至关重要。

三种实现路径

1. 多模态 LLM 原生支持

GPT-4V、Claude 3 Vision、Qwen-VL 等模型原生支持图片输入。最简单——直接把图片作为消息的一部分传入,LLM 自动理解并作出反应。

// OpenAI API 多模态消息
{
  "role": "user",
  "content": [
    { "type": "text", "text": "这张 X 光片有什么异常?" },
    { "type": "image_url", "image_url": { "url": "..." } }
  ]
}

优点:开发成本低、视觉理解能力强
缺点:Token 消耗大(每张图 ≈ 数百至上千 Token)、延迟高

2. 视觉工具调用 (Tool-based Vision)

Agent 将图片处理交给专用工具——OCR 提取文字、图像描述模型生成文本摘要、目标检测模型标注区域。LLM 只处理文字。

用户: "这个发票的总金额是多少?"
Agent 思考: 需要 OCR 提取文字
  → 调用 ocr_extract(image_path) → "金额: ¥12,800"
  → 推理: 总金额是 12,800 元
  → 回复用户

优点:Token 消耗低、延迟可接受、工具可替换
缺点:信息在工具转换中有损失

3. 混合策略

先用轻量视觉工具做预筛选,复杂场景再走多模态 LLM 深度分析。平衡成本与效果的最佳实践。

实践场景

  • 文档问答:PDF/扫描件 → OCR → 文本检索 → RAG 回答
  • 图表分析:截图 → 图表描述模型 → 结构化数据 → 推理分析
  • 视觉导航:UI 截图 → 元素定位 → 操作决策 → 点击执行
  • 图纸审查:CAD 图 → 区域标注 → 规则检查 → 报告生成

推荐策略

起步阶段用路径 2(工具调用),成本可控、效果明确。当场景需要在图片中做复杂推理(空间关系、表情理解、图表判断)时,升级到路径 3(混合)或路径 1(原生)。关键指标:图片处理耗时 < LLM 推理耗时才值得引入。

未标记