原创

CV、NLP、LLM 和 Agent 怎么选:AI 就业方向学习地图

解释计算机视觉、自然语言处理、大语言模型和 AI Agent 的关系、典型任务、技术栈与作品集差异,帮助学习者按兴趣、已有基础、目标行业和就业岗位选择一条主方向。

AI 学习路线 AI 学习路线 计算机视觉 NLP LLM AI Agent
AI 从零基础到就业专题 · 第 4/6 篇查看专题目录 →

CV、NLP、LLM 和 Agent 不是四门互不相干的课程。CV 与 NLP 是按数据类型和任务划分的领域;LLM 是语言模型规模化和通用化后的重要技术路线;Agent 则是在模型之外加入工具、状态、规则与执行流程的系统形态。

CV、NLP、LLM 与 Agent 的方向关系图

一、CV:让机器处理图像与视频

CV 的典型任务是分类、目标检测、分割、关键点、OCR、跟踪与图像生成。入门先学习图像矩阵、颜色空间、缩放裁剪、卷积和数据增强,再用迁移学习完成分类,之后选择检测或分割深入。

常用材料包括 OpenCV Tutorials 和 PyTorch/torchvision 教程。项目应包含采集与标注规范、类别分布、增强策略、按场景切分的数据、mAP/IoU 或任务指标,以及失败图片。

适合喜欢图像、工业、医疗影像、自动驾驶、零售或视频的人。门槛常在数据标注、计算资源和场景泛化,不只是换一个更大的模型。

二、NLP:处理语言中的结构与任务

传统 NLP 包括文本分类、实体识别、信息抽取、检索、翻译和摘要。学习词与子词、分词、向量表示、序列标注、检索指标和 Transformer。NLP 基础能帮助你理解 LLM 为什么会在实体、否定、长文档和事实一致性上失败。

项目可以做“合同字段抽取”或“客服意图识别”。除了总体分数,还要按类别、文本长度、领域术语和歧义样本分析错误。

三、LLM:从单任务模型走向通用语言接口

LLM 是 NLP 的重要分支,但工作重点常从“训练一个专用模型”转向“选择模型、设计上下文、检索证据、结构化输出、评测与控制成本”。学习 Token、上下文窗口、Embedding、Prompt、RAG、微调、模型评测和安全边界。

Hugging Face LLM Course 同时覆盖 NLP 基础和现代 LLM 技术。项目不要只做聊天壳,应展示引用、拒答、测试集、延迟和费用。

四、Agent:把模型放进可执行系统

Agent 通常由模型、指令、工具、状态/记忆、循环和权限组成。它适合多步骤、需要调用外部系统的任务,但不意味着越自主越好。固定流程能解决的问题,优先用确定性工作流;只有路径确实依赖上下文判断时,才增加 Agent 自主性。

学习工具 Schema、结构化输出、状态机、幂等、审批、沙箱、日志、追踪和回滚。可参考 Hugging Face Agents Course,同时结合本站的Agent Harness 专题理解权限和可观测性。

五、如何选择

判断问题 更匹配的方向
输入核心是图片、摄像头或医学影像 CV
任务是分类、抽取、翻译或语言研究 NLP
目标是知识助手、生成与企业文本应用 LLM
需要跨系统执行、多步骤协作与审批 Agent
想尽快发挥已有后端开发经验 LLM 应用/Agent
想进入模型算法研究 深度学习后选 CV 或 NLP

用两周小实验而不是想象做决定:CV 做一个迁移学习分类器;NLP 做一个文本分类器;LLM 做一个带引用问答;Agent 做一个只能读文件和生成报告的受限工具调用流程。比较你是否喜欢数据、错误分析和实际开发过程。

六、先用两周完成方向试学

第一周做两个最小任务:用迁移学习完成图片二分类;用预训练模型完成文本分类。第二周做一个带引用的小型 RAG,再为它增加一个只读工具。每个实验最多投入两天,最后一天比较四项:是否愿意继续处理这种数据、调试是否有成就感、本地岗位是否需要、已有经验能否复用。

选择不是永久决定。先承诺 12 周主线,在完成一个完整项目后再评估;不要因为一两天遇到报错就换方向,也不要因为演示效果炫酷就忽略数据与岗位需求。

七、四条方向的 12 周路线

CV 路线

周次 内容 项目推进
1–2 OpenCV、图像矩阵、颜色、几何变换 建立图像读取与质量检查脚本
3–4 CNN、增强、迁移学习 完成分类基线与混淆矩阵
5–6 检测、mAP、标注格式 训练小型目标检测模型
7–8 分割、IoU、场景切分 比较检测与分割适用性
9–10 推理优化、批处理、摄像头/视频 暴露推理 API 并测延迟
11–12 错误集、部署、项目报告 完成缺陷检测或票据识别项目

NLP 路线

周次 内容 项目推进
1–2 清洗、分词、TF-IDF、文本基线 完成意图分类基线
3–4 Embedding、序列任务、实体识别 标注并训练字段抽取模型
5–6 Transformer、预训练模型 微调并比较传统基线
7–8 检索、排序、文本相似度 建立搜索与召回评测
9–10 错误分类、长文本和领域术语 按样本类型修复失败
11–12 API、批处理、监控 完成合同或客服文本系统

LLM 应用路线

周次 内容 项目推进
1–2 API、Token、参数、结构化输出 信息抽取服务
3–4 Embedding、切块、向量检索 RAG 检索基线
5–6 引用、拒答、重排、评测集 带证据的知识助手
7–8 Prompt/模型版本、成本、缓存 自动回归与费用记录
9–10 API、数据库、Docker、日志 可部署服务
11–12 权限、安全、用户反馈 生产级作品集说明

Agent 路线

周次 内容 项目推进
1–2 工具 Schema、结构化参数 两个只读工具调用
3–4 工作流、状态机、重试、幂等 确定性多步骤流程
5–6 Agent 循环、规划、停止条件 有预算上限的任务 Agent
7–8 记忆、上下文与权限 区分状态、知识和审计日志
9–10 审批、沙箱、追踪、回放 高风险操作人工确认
11–12 回归评测、降级与部署 可审计的任务助手

八、不要同时深挖四条线

建议公共基础占 30%,主方向占 60%,相邻能力占 10%。CV 主线仍需工程部署;LLM 主线仍需理解机器学习评测;Agent 主线仍需掌握后端和安全。主方向代表你的作品集主题,不代表拒绝其他知识。

确定走 LLM/Agent 后,继续阅读应用开发与生产化路线;选择 CV 或传统 NLP,也应沿用同样的数据、评测和工程验收标准。

实测与内容说明

实测记录

  • 方向比较描述的是常见任务边界,具体公司岗位名称可能交叉或变化。
  • 选择方向前应抽样查看目标地区和行业的真实招聘要求。

参考资料

内容版本 1.1 · 审核:站点编辑 · 计划复审:2027-01-04