本地免费 API
本地运行的“免费”主要是没有云服务商按 Token 计费。你仍然需要下载模型、磁盘空间、内存、显卡或较长的 CPU 推理时间,并负责软件更新和数据备份。
三条常见路线
Section titled “三条常见路线”| 工具 | 官方入口 | 适合谁 | API 入口 |
|---|---|---|---|
| Ollama | 官网 · GitHub | 想用命令快速下载和运行模型 | 默认本机地址通常是 http://127.0.0.1:11434/v1,以当前文档为准 |
| LM Studio | 官网 · 文档 | 更喜欢图形界面、模型目录和本地 Server | 在 Developer / Local Server 页面查看当前端口和 OpenAI 兼容地址 |
| llama.cpp | GitHub | 想了解量化模型、命令行和底层推理 | llama-server 可启动 OpenAI 兼容 HTTP 服务,参数以 README 为准 |
模型来源还可以查看 Hugging Face Models 和 ModelScope。下载前先看模型许可证、文件大小、量化格式和硬件要求。
Ollama 新手流程
Section titled “Ollama 新手流程”- 从 Ollama 官网 安装适合 Windows、macOS 或 Linux 的版本。
- 在终端运行官方模型页给出的命令,例如先下载一个适合本机的轻量模型。
- 用 Ollama 应用或命令行确认模型能正常回答简单问题。
- 如果要接入 EasyAI,打开 Ollama 的本地 API 或确认服务已经运行,再查看当前 OpenAI 兼容地址。
- 在 EasyAI 添加服务商:API 类型选择
OpenAI Chat Completions,Base URL 填本机兼容地址,API Key 按本地服务要求留空或填写占位内容,模型填写本地模型名。 - 执行 重新检测,再启动短会话测试。
不同版本、操作系统和启动方式可能使用不同端口或路径。不要把这里的示例地址直接当成所有环境的固定值,优先复制工具当前界面或官方文档显示的地址。
本地硬件怎么估算
Section titled “本地硬件怎么估算”- 模型文件越大,下载时间、磁盘和内存需求越高;
- 量化模型通常更省资源,但可能影响速度或效果;
- 没有独立显卡也可以用 CPU 运行较小模型,只是响应可能更慢;
- 多个 Agent 同时调用会争抢内存和显存;
- 笔记本电脑长时间高负载时要注意温度、电源和磁盘空间。
本地 API 的边界
Section titled “本地 API 的边界”本地运行可以减少数据离开电脑的机会,但不自动等于绝对安全。第三方模型、扩展、Skill、MCP Server 或插件仍可能读取文件和访问网络。只安装可信来源,使用最小文件权限,不要把本地端口直接暴露到公网。
如果 EasyAI 运行在另一台电脑或容器里,127.0.0.1 指的是那台运行 EasyAI 的机器,而不是你的桌面电脑;这时需要按网络拓扑配置可访问地址,并配合防火墙和认证。
何时换回云 API
Section titled “何时换回云 API”当本地速度、上下文长度、工具调用或模型能力不足时,可以把同一 Agent 切换到 国际免费额度、国内免费额度 或正式 API。建议保留本地服务作为低敏感任务和离线学习的备用路线。