多模态与模型选择
先按任务分类
Section titled “先按任务分类”| 任务 | 优先关注 | 不要只看 |
|---|---|---|
| 日常问答、改写 | 稳定性、速度、上下文 | 排行榜名次 |
| 写代码、改项目 | 代码能力、工具配合、长上下文 | 单次回答是否漂亮 |
| 复杂分析 | 推理质量、可验证性、成本 | 输出越长越好 |
| 图片理解 | 视觉能力、格式限制 | 纯文本评测 |
| 批量处理 | 价格、速率、失败重试 | 人工体验 |
什么是多模态
Section titled “什么是多模态”多模态模型可以同时理解不止一种信息,例如文字和图片。你可以让它解释截图、读取表格、分析界面布局或提取照片中的文字,但仍然要注意图片模糊、敏感信息和识别错误。
给图片任务的提示词建议包含:
- 图片中需要关注的区域;
- 需要输出的格式(清单、表格或 JSON);
- 无法确认时如何标记;
- 是否允许根据常识推测。
选模型的五个问题
Section titled “选模型的五个问题”- 这个任务必须支持图片、音频或视频吗?
- 需要一次读多少文字和文件?
- 对延迟、成本和输出稳定性的优先级是什么?
- 数据能否发送到第三方服务,是否需要区域或企业合规?
- 是否需要工具调用、结构化输出或特定 API 协议?
用小测试代替猜测
Section titled “用小测试代替猜测”准备一组 5~10 个真实样例,包含正常输入、边界输入和容易出错的输入。为每个模型记录:
- 是否完成任务;
- 是否遵守格式;
- 是否出现事实错误;
- 用时和费用;
- 失败时是否容易定位。
测试结果比“某模型听起来更强”更能指导选择。模型、价格和可用区域都会变化,测试应在你真正使用的服务商入口上进行。
在 EasyAI 中的实践
Section titled “在 EasyAI 中的实践”- 日常任务先配置一个稳定、成本可控的默认模型;
- 复杂任务保留一个更强的备用模型;
- 给不同服务商使用清晰的名称和准确的模型 ID;
- 发生 401、403、429 或余额错误时,先看服务商状态和额度,再判断是否是模型问题;
- 不把 API Key、客户数据和内部文档放进公开提示词或截图。