模型社区与本地运行
模型、数据集和 Demo 社区
Section titled “模型、数据集和 Demo 社区”| 社区 | 模型 | 数据/应用 | 适合什么 |
|---|---|---|---|
| Hugging Face | Models | Datasets · Spaces | 国际模型、数据集、在线 Demo 和文档 |
| ModelScope / 魔搭 | Models | Datasets · Studios | 国内模型、数据集和创空间 |
| Kaggle | Models | Datasets · Competitions | 数据科学、Notebook 和公开数据 |
| GitHub Models | Models | 文档 | 在 GitHub 生态中试用模型 |
| Replicate | Explore | API | 在线调用开源模型 |
| Ollama Library | Library | Docs | 下载适合本地运行的模型 |
| LM Studio Discover | 官网 | Docs | 桌面端下载和运行本地模型 |
本地运行路线
Section titled “本地运行路线”Ollama
Section titled “Ollama”适合第一次在本机运行模型:安装后从 Library 选择模型,用命令行或本地 API 调用。需要关注模型大小、内存、显存、磁盘和许可证。
LM Studio
Section titled “LM Studio”适合喜欢图形界面的用户:搜索 GGUF 模型、下载、加载并提供 OpenAI 兼容本地接口。不同模型的量化格式、上下文和显存要求不同。
llama.cpp
Section titled “llama.cpp”适合需要更细控制、命令行或嵌入式部署的用户。它支持多种量化模型和硬件后端,但安装参数、编译和性能调优更偏开发者。
vLLM / SGLang
Section titled “vLLM / SGLang”适合服务器 GPU、高并发和团队服务化部署。需要处理 GPU 驱动、显存、并发、批处理、监控和安全,不建议作为第一台本地模型的入门工具。
下载模型前检查
Section titled “下载模型前检查”- 模型来源:确认发布者、仓库、版本和文件完整性;
- 许可证:是否允许商业使用、再分发或微调;
- 硬件要求:参数量、量化、上下文、内存、显存和磁盘;
- 输入数据:本地推理不代表所有数据都安全,插件和联网功能仍可能上传内容;
- 模型行为:偏见、幻觉、版权、隐私和安全风险仍需评估;
- 来源链接:优先从官方模型卡、原始论文或厂商页面下载。
模型卡要看什么
Section titled “模型卡要看什么”- 训练数据和已知限制;
- 评测结果与适用语言;
- 推荐硬件和推理参数;
- 输入输出格式和上下文长度;
- 许可证与商用限制;
- 安全说明和版本更新。
下载量和排行榜可以帮助发现模型,但不等于模型适合你的任务。准备一组真实样例,比较质量、速度和资源消耗。
本地模型与 API 模型如何选择
Section titled “本地模型与 API 模型如何选择”| 需求 | 更适合 |
|---|---|
| 想快速开始、设备一般、需要最新模型 | 官方 API 或聚合平台 |
| 数据不能离开设备、任务可以接受本地能力 | Ollama / LM Studio 等本地运行 |
| 团队有 GPU、需要高并发和可控成本 | vLLM / SGLang 服务化 |
| 想学习模型推理和部署 | llama.cpp、Transformers、Docker |