原创

AI 学习第二阶段:机器学习、深度学习与 Transformer

从数据切分、基线和指标开始学习机器学习,再进入 PyTorch、神经网络和 Transformer;重点说明数学学到哪里、实验如何记录,以及怎样判断模型真的有效。

AI 从零基础到就业专题 · 第 3/6 篇查看专题目录 →

机器学习阶段最重要的习惯,是先定义问题和验证方法,再选择模型。模型越复杂,越容易用漂亮曲线掩盖数据泄漏、错误切分和无效指标。

一、数学学到“能解释和调试”

线性代数理解向量、矩阵、点积、矩阵乘法、范数和形状;概率统计理解分布、期望、方差、条件概率、抽样、置信区间和假设检验;微积分理解导数、偏导、链式法则和梯度下降。

学习顺序应当与代码结合:先用 NumPy 计算,再画图观察,最后用公式解释。应用岗位不必等数学全部学完才写模型,但遇到损失函数、归一化或梯度问题时,必须回到原理补齐。

二、机器学习的完整闭环

第一步是写问题定义:输入是什么、输出是什么、预测发生在什么时间、错误的业务代价是什么。第二步建立最简单基线,例如多数类、均值、规则或线性模型。第三步才是特征、模型、调参和比较。

必学模型包括线性/逻辑回归、决策树、随机森林、梯度提升、KNN、朴素贝叶斯、聚类与降维。目标不是手推每个细节,而是知道假设、输入要求、优缺点和适用场景。

使用 scikit-learn 练习 Pipeline、预处理、交叉验证、参数搜索和模型保存。任何实验都记录数据版本、切分规则、随机种子、参数、指标和错误样本。

三、指标必须对应错误代价

分类任务不要只看 Accuracy。类别不平衡时关注 Precision、Recall、F1、PR-AUC;排序任务关注 Top-K 和 NDCG;回归任务比较 MAE、RMSE 与业务容忍范围。需要概率时还要看校准,而不只是类别是否正确。

时间数据应按时间切分,用户行为通常按用户隔离。训练集出现未来字段、同一对象同时进入训练与验证,都会制造虚假高分。

四、进入 PyTorch 与深度学习

先掌握张量、Dataset/DataLoader、模型层、前向传播、损失、反向传播、优化器和训练循环;然后学习 MLP、CNN、Embedding、RNN 的基本思想,再进入注意力和 Transformer。

训练时至少观察训练/验证损失、主要指标、学习率和错误样本。出现过拟合时从更多数据、数据增强、正则化、早停和模型复杂度处理,而不是盲目延长训练。

PyTorch Tutorials 适合配合最小项目;Dive into Deep Learning 可用于把数学、代码与模型章节对应起来。

五、Transformer 应该理解什么

重点理解 Token/Embedding、位置表达、自注意力、前馈网络、残差连接和归一化,以及 encoder-only、decoder-only、encoder-decoder 的任务差异。至少能解释上下文长度、注意力成本、预训练、指令微调和推理分别在解决什么问题。

不要求从零训练大模型。更有价值的练习是使用一个小型预训练模型完成分类或生成任务,建立基线,微调后比较质量、显存、速度和错误类型。

六、10 周逐步学习计划

周次 学习重点 必做实验 完成标准
第 1 周 向量、矩阵、均值、方差、概率 NumPy 手算线性回归 能解释形状、误差和梯度方向
第 2 周 问题定义、数据切分、基线 多数类/均值/规则基线 先有基线再训练模型
第 3 周 线性回归、逻辑回归 分类与回归各一次 能解释系数和损失
第 4 周 决策树、随机森林、提升树 比较三类模型 固定切分并记录参数
第 5 周 特征处理、Pipeline、交叉验证 防止预处理泄漏 训练和验证流程完全分离
第 6 周 指标、不平衡、阈值、校准 Precision/Recall 权衡 按业务代价选择阈值
第 7 周 PyTorch 张量与自动求导 手写训练循环 能定位维度和梯度错误
第 8 周 MLP、CNN、Embedding 图像或文本小模型 保存、加载并批量推理
第 9 周 注意力与 Transformer 调用预训练模型 解释 Token、Mask 和输出
第 10 周 迁移学习、错误分析、实验报告 三轮对照实验 形成可复现实验表和失败集

数学补课顺序

不要连续几个月只学数学。遇到模型概念时按需补:看线性模型时补向量和导数;看概率输出时补条件概率与校准;看神经网络时补链式法则;看注意力时补矩阵乘法和 Softmax。每个公式至少完成一次小数组手算、一次 NumPy 实现、一次框架验证。

实验记录模板

每轮实验记录六项:假设、数据版本、切分方法、模型与参数、主要指标、失败样本。一次只改变一个主要因素。没有记录的最好分数不可复现,也不能证明能力。

七、阶段项目

做一个“投诉文本分类”或“商品图片分类”项目:保留原始数据说明,建立规则/传统模型基线,再加入深度学习模型;使用独立测试集比较,写出混淆矩阵和至少 20 个错误样本分析。

项目目录至少分开数据准备、训练、评测和推理入口。训练脚本固定随机种子并保存配置;评测脚本只读取冻结的测试集;推理入口加载已保存模型,不在请求时重新训练。这样面试者才能复现结果,也能判断你是否真正理解训练和服务的边界。

至少做三轮对照实验:简单基线、改进特征或网络、最终候选。每轮只改变少量因素,并记录训练时间、主要指标和资源占用。模型没有提升也可以成为有效证据,前提是你说明假设为何不成立,而不是只保留最好的一次运行。

进入方向阶段前,你应该能回答:为什么这样切分数据?为什么使用这个指标?模型相比基线提升多少?代价是什么?哪些样本仍会失败?怎样保存并重新加载模型?如果这些问题还只能背定义,回到专题总路线图检查阶段门槛。

下一步阅读CV、NLP、LLM 与 Agent 方向选择。如果准备做 LLM 项目,也建议先浏览大模型评测方法专题,避免只凭少量主观样例选择模型。

实测与内容说明

实测记录

  • 数学范围按应用型 AI 工程目标选择,研究型岗位需要进一步补充概率、优化与论文训练。
  • 任何指标都必须结合任务代价、数据切分与基线解释。

参考资料

内容版本 1.1 · 审核:站点编辑 · 计划复审:2027-04-04