研究、评测与课程
论文和研究搜索
Section titled “论文和研究搜索”| 资源 | 入口 | 适合什么 |
|---|---|---|
| arXiv | cs.AI · cs.CL | 最新论文预印本 |
| Papers with Code | paperswithcode.com | 论文、代码、数据集和榜单关联 |
| Hugging Face Papers | Daily Papers | 社区关注的论文和实现 |
| Semantic Scholar | AI Research | 论文搜索、引用和相关工作 |
| Google Scholar | scholar.google.com | 广泛学术搜索 |
| Stanford AI Index | 报告 | AI 产业、研究和政策年度数据 |
| Epoch AI | 研究 | 模型、算力和 AI 趋势分析 |
| MIT AI News | MIT News | 研究机构新闻和通俗解释 |
论文预印本不一定经过同行评审;阅读时看作者、机构、代码、数据、实验设置和限制,不要只看标题或排行榜。
模型和应用评测
Section titled “模型和应用评测”| 资源 | 入口 | 适合什么 |
|---|---|---|
| LMSYS Chatbot Arena | arena.ai | 盲测对比聊天模型 |
| Artificial Analysis | artificialanalysis.ai | 模型质量、速度、价格对比 |
| Open LLM Leaderboard | Hugging Face | 开源模型评测 |
| Stanford HELM | crfm.stanford.edu/helm | 多维度模型评测框架 |
| OpenCompass | GitHub | 多模型评测和中文生态 |
| lm-evaluation-harness | GitHub | 可复用评测任务 |
| Ragas | GitHub | RAG 检索与回答质量 |
| Promptfoo | GitHub | 提示词、模型和安全测试 |
| DeepEval | GitHub | LLM 应用自动评测 |
公开榜单有助于发现模型,但不能代替你的真实样例。对 EasyAI 工作流,更应该测试模型是否能正确调用工具、遵守文件范围、处理错误和控制成本。
| 课程 | 入口 | 适合谁 |
|---|---|---|
| Google ML Crash Course | 课程 | 机器学习和 LLM 基础 |
| fast.ai | Practical Deep Learning | 用项目入门深度学习 |
| DeepLearning.AI | 课程 | 机器学习、生成式 AI 和 Agent |
| Full Stack Deep Learning | 课程 | 把模型应用做成可维护产品 |
| Made With ML | 课程 | 从数据到生产 ML 工程 |
| Hugging Face Course | 课程 | Transformers、数据集和 Diffusers |
| Stanford CS25 | Transformers United | Transformer 研究讲座 |
| Stanford CS336 | Language Modeling | 语言模型原理和训练 |
| Microsoft AI for Beginners | GitHub | 中文等多语言基础课程 |
| Datawhale | GitHub | 中文开源学习和实践 |
- Hugging Face Blog:模型、工具和研究实践。
- The Batch:DeepLearning.AI 的 AI 新闻。
- Import AI:研究、政策和产业观察。
- Latent Space:模型、Agent 和 AI 工程访谈。
- 机器之心:中文 AI 研究和产业资讯。
- 量子位:中文 AI 产品与行业动态。
- GitHub Trending AI:发现近期热门开源项目。
新闻、博客和社区帖子适合发现线索;涉及 API 行为、价格、许可证和安全时,必须回到官方文档或原始仓库。
做自己的评测集
Section titled “做自己的评测集”- 收集 10~50 个真实任务,覆盖正常、边界和应该拒绝的情况;
- 写出期望结果、不可接受结果和评分标准;
- 比较模型质量、延迟、价格、稳定性和可追溯性;
- 每次换模型、提示词或工具后重新运行;
- 保存失败样例,作为下一轮改进的依据。