CV、NLP、LLM 和 Agent 不是四门互不相干的课程。CV 与 NLP 是按数据类型和任务划分的领域;LLM 是语言模型规模化和通用化后的重要技术路线;Agent 则是在模型之外加入工具、状态、规则与执行流程的系统形态。
一、CV:让机器处理图像与视频
CV 的典型任务是分类、目标检测、分割、关键点、OCR、跟踪与图像生成。入门先学习图像矩阵、颜色空间、缩放裁剪、卷积和数据增强,再用迁移学习完成分类,之后选择检测或分割深入。
常用材料包括 OpenCV Tutorials 和 PyTorch/torchvision 教程。项目应包含采集与标注规范、类别分布、增强策略、按场景切分的数据、mAP/IoU 或任务指标,以及失败图片。
适合喜欢图像、工业、医疗影像、自动驾驶、零售或视频的人。门槛常在数据标注、计算资源和场景泛化,不只是换一个更大的模型。
二、NLP:处理语言中的结构与任务
传统 NLP 包括文本分类、实体识别、信息抽取、检索、翻译和摘要。学习词与子词、分词、向量表示、序列标注、检索指标和 Transformer。NLP 基础能帮助你理解 LLM 为什么会在实体、否定、长文档和事实一致性上失败。
项目可以做“合同字段抽取”或“客服意图识别”。除了总体分数,还要按类别、文本长度、领域术语和歧义样本分析错误。
三、LLM:从单任务模型走向通用语言接口
LLM 是 NLP 的重要分支,但工作重点常从“训练一个专用模型”转向“选择模型、设计上下文、检索证据、结构化输出、评测与控制成本”。学习 Token、上下文窗口、Embedding、Prompt、RAG、微调、模型评测和安全边界。
Hugging Face LLM Course 同时覆盖 NLP 基础和现代 LLM 技术。项目不要只做聊天壳,应展示引用、拒答、测试集、延迟和费用。
四、Agent:把模型放进可执行系统
Agent 通常由模型、指令、工具、状态/记忆、循环和权限组成。它适合多步骤、需要调用外部系统的任务,但不意味着越自主越好。固定流程能解决的问题,优先用确定性工作流;只有路径确实依赖上下文判断时,才增加 Agent 自主性。
学习工具 Schema、结构化输出、状态机、幂等、审批、沙箱、日志、追踪和回滚。可参考 Hugging Face Agents Course,同时结合本站的Agent Harness 专题理解权限和可观测性。
五、如何选择
| 判断问题 | 更匹配的方向 |
|---|---|
| 输入核心是图片、摄像头或医学影像 | CV |
| 任务是分类、抽取、翻译或语言研究 | NLP |
| 目标是知识助手、生成与企业文本应用 | LLM |
| 需要跨系统执行、多步骤协作与审批 | Agent |
| 想尽快发挥已有后端开发经验 | LLM 应用/Agent |
| 想进入模型算法研究 | 深度学习后选 CV 或 NLP |
用两周小实验而不是想象做决定:CV 做一个迁移学习分类器;NLP 做一个文本分类器;LLM 做一个带引用问答;Agent 做一个只能读文件和生成报告的受限工具调用流程。比较你是否喜欢数据、错误分析和实际开发过程。
六、先用两周完成方向试学
第一周做两个最小任务:用迁移学习完成图片二分类;用预训练模型完成文本分类。第二周做一个带引用的小型 RAG,再为它增加一个只读工具。每个实验最多投入两天,最后一天比较四项:是否愿意继续处理这种数据、调试是否有成就感、本地岗位是否需要、已有经验能否复用。
选择不是永久决定。先承诺 12 周主线,在完成一个完整项目后再评估;不要因为一两天遇到报错就换方向,也不要因为演示效果炫酷就忽略数据与岗位需求。
七、四条方向的 12 周路线
CV 路线
| 周次 | 内容 | 项目推进 |
|---|---|---|
| 1–2 | OpenCV、图像矩阵、颜色、几何变换 | 建立图像读取与质量检查脚本 |
| 3–4 | CNN、增强、迁移学习 | 完成分类基线与混淆矩阵 |
| 5–6 | 检测、mAP、标注格式 | 训练小型目标检测模型 |
| 7–8 | 分割、IoU、场景切分 | 比较检测与分割适用性 |
| 9–10 | 推理优化、批处理、摄像头/视频 | 暴露推理 API 并测延迟 |
| 11–12 | 错误集、部署、项目报告 | 完成缺陷检测或票据识别项目 |
NLP 路线
| 周次 | 内容 | 项目推进 |
|---|---|---|
| 1–2 | 清洗、分词、TF-IDF、文本基线 | 完成意图分类基线 |
| 3–4 | Embedding、序列任务、实体识别 | 标注并训练字段抽取模型 |
| 5–6 | Transformer、预训练模型 | 微调并比较传统基线 |
| 7–8 | 检索、排序、文本相似度 | 建立搜索与召回评测 |
| 9–10 | 错误分类、长文本和领域术语 | 按样本类型修复失败 |
| 11–12 | API、批处理、监控 | 完成合同或客服文本系统 |
LLM 应用路线
| 周次 | 内容 | 项目推进 |
|---|---|---|
| 1–2 | API、Token、参数、结构化输出 | 信息抽取服务 |
| 3–4 | Embedding、切块、向量检索 | RAG 检索基线 |
| 5–6 | 引用、拒答、重排、评测集 | 带证据的知识助手 |
| 7–8 | Prompt/模型版本、成本、缓存 | 自动回归与费用记录 |
| 9–10 | API、数据库、Docker、日志 | 可部署服务 |
| 11–12 | 权限、安全、用户反馈 | 生产级作品集说明 |
Agent 路线
| 周次 | 内容 | 项目推进 |
|---|---|---|
| 1–2 | 工具 Schema、结构化参数 | 两个只读工具调用 |
| 3–4 | 工作流、状态机、重试、幂等 | 确定性多步骤流程 |
| 5–6 | Agent 循环、规划、停止条件 | 有预算上限的任务 Agent |
| 7–8 | 记忆、上下文与权限 | 区分状态、知识和审计日志 |
| 9–10 | 审批、沙箱、追踪、回放 | 高风险操作人工确认 |
| 11–12 | 回归评测、降级与部署 | 可审计的任务助手 |
八、不要同时深挖四条线
建议公共基础占 30%,主方向占 60%,相邻能力占 10%。CV 主线仍需工程部署;LLM 主线仍需理解机器学习评测;Agent 主线仍需掌握后端和安全。主方向代表你的作品集主题,不代表拒绝其他知识。
确定走 LLM/Agent 后,继续阅读应用开发与生产化路线;选择 CV 或传统 NLP,也应沿用同样的数据、评测和工程验收标准。