跳转到内容

多模态与模型选择

任务 优先关注 不要只看
日常问答、改写 稳定性、速度、上下文 排行榜名次
写代码、改项目 代码能力、工具配合、长上下文 单次回答是否漂亮
复杂分析 推理质量、可验证性、成本 输出越长越好
图片理解 视觉能力、格式限制 纯文本评测
批量处理 价格、速率、失败重试 人工体验

多模态模型可以同时理解不止一种信息,例如文字和图片。你可以让它解释截图、读取表格、分析界面布局或提取照片中的文字,但仍然要注意图片模糊、敏感信息和识别错误。

给图片任务的提示词建议包含:

  1. 图片中需要关注的区域;
  2. 需要输出的格式(清单、表格或 JSON);
  3. 无法确认时如何标记;
  4. 是否允许根据常识推测。
  1. 这个任务必须支持图片、音频或视频吗?
  2. 需要一次读多少文字和文件?
  3. 对延迟、成本和输出稳定性的优先级是什么?
  4. 数据能否发送到第三方服务,是否需要区域或企业合规?
  5. 是否需要工具调用、结构化输出或特定 API 协议?

准备一组 5~10 个真实样例,包含正常输入、边界输入和容易出错的输入。为每个模型记录:

  • 是否完成任务;
  • 是否遵守格式;
  • 是否出现事实错误;
  • 用时和费用;
  • 失败时是否容易定位。

测试结果比“某模型听起来更强”更能指导选择。模型、价格和可用区域都会变化,测试应在你真正使用的服务商入口上进行。

  • 日常任务先配置一个稳定、成本可控的默认模型;
  • 复杂任务保留一个更强的备用模型;
  • 给不同服务商使用清晰的名称和准确的模型 ID;
  • 发生 401、403、429 或余额错误时,先看服务商状态和额度,再判断是否是模型问题;
  • 不把 API Key、客户数据和内部文档放进公开提示词或截图。