跳转到内容

本地免费 API

本地运行的“免费”主要是没有云服务商按 Token 计费。你仍然需要下载模型、磁盘空间、内存、显卡或较长的 CPU 推理时间,并负责软件更新和数据备份。

工具 官方入口 适合谁 API 入口
Ollama 官网 · GitHub 想用命令快速下载和运行模型 默认本机地址通常是 http://127.0.0.1:11434/v1,以当前文档为准
LM Studio 官网 · 文档 更喜欢图形界面、模型目录和本地 Server 在 Developer / Local Server 页面查看当前端口和 OpenAI 兼容地址
llama.cpp GitHub 想了解量化模型、命令行和底层推理 llama-server 可启动 OpenAI 兼容 HTTP 服务,参数以 README 为准

模型来源还可以查看 Hugging Face ModelsModelScope。下载前先看模型许可证、文件大小、量化格式和硬件要求。

  1. Ollama 官网 安装适合 Windows、macOS 或 Linux 的版本。
  2. 在终端运行官方模型页给出的命令,例如先下载一个适合本机的轻量模型。
  3. 用 Ollama 应用或命令行确认模型能正常回答简单问题。
  4. 如果要接入 EasyAI,打开 Ollama 的本地 API 或确认服务已经运行,再查看当前 OpenAI 兼容地址。
  5. 在 EasyAI 添加服务商:API 类型选择 OpenAI Chat Completions,Base URL 填本机兼容地址,API Key 按本地服务要求留空或填写占位内容,模型填写本地模型名。
  6. 执行 重新检测,再启动短会话测试。

不同版本、操作系统和启动方式可能使用不同端口或路径。不要把这里的示例地址直接当成所有环境的固定值,优先复制工具当前界面或官方文档显示的地址。

  • 模型文件越大,下载时间、磁盘和内存需求越高;
  • 量化模型通常更省资源,但可能影响速度或效果;
  • 没有独立显卡也可以用 CPU 运行较小模型,只是响应可能更慢;
  • 多个 Agent 同时调用会争抢内存和显存;
  • 笔记本电脑长时间高负载时要注意温度、电源和磁盘空间。

本地运行可以减少数据离开电脑的机会,但不自动等于绝对安全。第三方模型、扩展、Skill、MCP Server 或插件仍可能读取文件和访问网络。只安装可信来源,使用最小文件权限,不要把本地端口直接暴露到公网。

如果 EasyAI 运行在另一台电脑或容器里,127.0.0.1 指的是那台运行 EasyAI 的机器,而不是你的桌面电脑;这时需要按网络拓扑配置可访问地址,并配合防火墙和认证。

当本地速度、上下文长度、工具调用或模型能力不足时,可以把同一 Agent 切换到 国际免费额度国内免费额度 或正式 API。建议保留本地服务作为低敏感任务和离线学习的备用路线。