模型、Token 与上下文窗口
先记住一句话
Section titled “先记住一句话”大模型不是一个装满答案的搜索框,而是根据你提供的上下文,预测下一段最合适文字的模型。它很擅长总结、改写、推理和生成,但它的结果仍然受输入信息、模型能力和工具权限限制。
模型到底是什么
Section titled “模型到底是什么”可以把模型理解成一个“能力引擎”。不同模型在速度、价格、上下文长度、代码能力、图片理解和稳定性上有差异。
| 名称 | 你可以把它理解为 | 使用时关注 |
|---|---|---|
| 基础模型 | 通用的语言或多模态能力 | 能处理什么输入、擅长什么任务 |
| 指令模型 | 更适合按要求完成任务 | 遵循格式、角色和限制的能力 |
| 推理模型 | 更愿意花时间拆解复杂问题 | 延迟、价格、推理深度 |
| 视觉/多模态模型 | 可以处理图片、音频或视频 | 支持的格式、清晰度和费用 |
模型名称不是能力的全部。真正使用前,先看服务商的模型说明、价格、上下文上限和可用区域;不要只凭排行榜或别人截图选择。
Token 是什么
Section titled “Token 是什么”Token 是模型处理文字时使用的片段,不完全等于“一个汉字”或“一个英文单词”。中文、英文、代码、表格和很长的 URL 可能占用不同数量的 Token。
Token 主要影响三件事:
- 费用:许多 API 按输入和输出 Token 计费。
- 上下文容量:一次请求能放入的历史消息、文件和工具结果有限。
- 速度:输入越长、输出越长,通常等待越久。
不要把“上下文窗口很大”理解成“模型已经永久记住了内容”。上下文通常只对当前会话或当前请求有效,是否跨会话保存要看具体产品。
上下文窗口如何工作
Section titled “上下文窗口如何工作”一次请求大致可以看成:
系统规则 + 你的指令 + 对话历史 + 文件/工具结果 + 本次输出这些内容共同占用上下文窗口。对话太长时,产品可能压缩、截断或总结早期内容;工具返回大量日志时,也可能挤掉真正重要的信息。
让上下文更有用
Section titled “让上下文更有用”- 先告诉 AI 当前目标,再提供与目标直接相关的文件和背景;
- 大文件先让 AI 总结目录、入口和关键函数,再按需深入;
- 把稳定规则放进项目说明,把一次性任务放在当前提示词里;
- 用小标题、列表和明确的分隔符组织材料;
- 让 AI 在开始前复述它理解的范围,发现误解就及时纠正。
幻觉为什么会发生
Section titled “幻觉为什么会发生”模型生成的是“看起来合理的回答”,不等于它自动查证过事实。没有可靠上下文时,它可能编造不存在的 API、版本、链接或引用。
高风险信息(价格、法律、医疗、账号权限、生产数据)要使用官方来源交叉确认。让 AI 标出不确定点,并提供来源或验证步骤,不能代替你自己核对。
一个简单的选择方法
Section titled “一个简单的选择方法”- 先判断任务是问答、写作、代码、视觉还是复杂推理;
- 选择一个满足能力要求的轻量模型做第一轮;
- 如果结果不稳定,再换更强模型或补充上下文;
- 对同一任务比较质量、速度和实际成本,而不是只看模型名称;
- 在 EasyAI 中保留一个可用的备用服务商,遇到额度或限流时再切换。
- OpenAI:模型概览
- OpenAI:Tokenizer
- Anthropic:模型概览
- Google Gemini:模型
- Google Machine Learning Crash Course:LLM
以上链接的模型名称、价格和限制会更新,实际使用前以服务商页面为准。