跳转到内容

研究、评测与课程

资源 入口 适合什么
arXiv cs.AI · cs.CL 最新论文预印本
Papers with Code paperswithcode.com 论文、代码、数据集和榜单关联
Hugging Face Papers Daily Papers 社区关注的论文和实现
Semantic Scholar AI Research 论文搜索、引用和相关工作
Google Scholar scholar.google.com 广泛学术搜索
Stanford AI Index 报告 AI 产业、研究和政策年度数据
Epoch AI 研究 模型、算力和 AI 趋势分析
MIT AI News MIT News 研究机构新闻和通俗解释

论文预印本不一定经过同行评审;阅读时看作者、机构、代码、数据、实验设置和限制,不要只看标题或排行榜。

资源 入口 适合什么
LMSYS Chatbot Arena arena.ai 盲测对比聊天模型
Artificial Analysis artificialanalysis.ai 模型质量、速度、价格对比
Open LLM Leaderboard Hugging Face 开源模型评测
Stanford HELM crfm.stanford.edu/helm 多维度模型评测框架
OpenCompass GitHub 多模型评测和中文生态
lm-evaluation-harness GitHub 可复用评测任务
Ragas GitHub RAG 检索与回答质量
Promptfoo GitHub 提示词、模型和安全测试
DeepEval GitHub LLM 应用自动评测

公开榜单有助于发现模型,但不能代替你的真实样例。对 EasyAI 工作流,更应该测试模型是否能正确调用工具、遵守文件范围、处理错误和控制成本。

课程 入口 适合谁
Google ML Crash Course 课程 机器学习和 LLM 基础
fast.ai Practical Deep Learning 用项目入门深度学习
DeepLearning.AI 课程 机器学习、生成式 AI 和 Agent
Full Stack Deep Learning 课程 把模型应用做成可维护产品
Made With ML 课程 从数据到生产 ML 工程
Hugging Face Course 课程 Transformers、数据集和 Diffusers
Stanford CS25 Transformers United Transformer 研究讲座
Stanford CS336 Language Modeling 语言模型原理和训练
Microsoft AI for Beginners GitHub 中文等多语言基础课程
Datawhale GitHub 中文开源学习和实践

新闻、博客和社区帖子适合发现线索;涉及 API 行为、价格、许可证和安全时,必须回到官方文档或原始仓库。

  1. 收集 10~50 个真实任务,覆盖正常、边界和应该拒绝的情况;
  2. 写出期望结果、不可接受结果和评分标准;
  3. 比较模型质量、延迟、价格、稳定性和可追溯性;
  4. 每次换模型、提示词或工具后重新运行;
  5. 保存失败样例,作为下一轮改进的依据。