原创

AI 学习第一阶段:Python、Git、Linux、SQL 与数据处理

把 AI 入门所需的公共工程基础拆成可验收任务:Python 编程、命令行、Git、SQL、NumPy、pandas、可视化和 API 基础,并给出练习项目与进入机器学习阶段的判断标准。

AI 从零基础到就业专题 · 第 2/6 篇查看专题目录 →

这一阶段的目标不是“学完 Python”,而是获得完成 AI 项目所需的最低工程自主性:能拿到数据、写成程序、定位错误、保存版本,并让别人复现。

一、Python 学到什么程度才够用

先掌握变量、字符串、列表、字典、集合、条件、循环、函数、模块、文件和异常。随后补类与对象、迭代器、生成器、上下文管理、类型提示和测试。元类、复杂装饰器和解释器内部原理暂时不是门槛。

练习不要停留在算法小题。写三个小工具:批量整理文件、请求一个公开 API 并保存 JSON、读取 CSV 后生成统计报告。每个工具都应有参数、错误提示和 README。

建议材料:先完成 Python 官方教程,不懂的标准库再按需查阅;把官方示例改成自己的数据,而不是原样复制。

二、命令行与环境管理

你需要理解当前目录、相对路径、环境变量、进程、端口和权限;会使用 cd、ls、pwd、mkdir、cp、mv、grep 或 rg、管道和重定向。Python 项目至少使用虚拟环境并固定依赖。

完成标准是能解释:程序从哪个目录启动、配置从哪里读取、依赖安装到哪里、端口为什么冲突、日志为何没有写到预期位置。很多“AI 问题”实际是路径、编码、依赖或网络问题。

三、Git 不是上传代码按钮

学习仓库、工作区、暂存区、提交、分支、合并和远程仓库。日常最低动作包括查看差异、只提交相关文件、写清提交信息、解决简单冲突,以及用 .gitignore 排除密钥和大文件。

推荐阅读 Pro Git 的入门、分支和远程章节。验收任务是把数据处理项目放入 Git:至少保留三次有意义的提交,并从一个新目录按 README 恢复运行。

四、SQL 与数据思维

模型之前先有数据。SQL 需要掌握 SELECT、过滤、排序、聚合、JOIN、子查询、CTE 和窗口函数;同时理解主键、唯一约束、空值、索引和事务的基本作用。

用一个包含用户、订单和商品的三表数据集练习:计算月度收入、复购率、用户最近一次行为,并输出可用于训练的特征表。重点不是语法花样,而是口径是否明确、连接是否产生重复、时间字段是否泄漏未来信息。

五、NumPy、pandas 与可视化

NumPy 重点是数组形状、索引、广播、向量化和随机数;pandas 重点是读取、类型、缺失值、去重、连接、分组、时间序列和导出。可视化至少会画分布、类别对比、趋势和相关关系,并为图表写一句结论。

每次分析必须保留数据字典:一行代表什么、字段来自哪里、单位是什么、缺失意味着什么。没有这些定义,再漂亮的图和再高的分数也可能建立在错误口径上。

六、HTTP 与 API 基础

理解 URL、请求方法、状态码、Header、JSON、超时和鉴权。能用 Python 请求接口,处理分页、限流、错误响应和重试。不要把 API Key 写进代码;从环境变量读取,并提供 .env.example。

这个能力会直接用于模型 API、数据源、在线推理和项目部署。此时不必先学完整前端,但要能通过命令行或简单页面调用自己的服务。

七、8 周逐步学习计划

周次 必学内容 当周练习 验收产物
第 1 周 变量、类型、条件、循环、函数 猜数、记账、文本统计 3 个可从命令行运行的脚本
第 2 周 列表、字典、文件、异常、模块 批量改名、日志分析 拆分模块并处理错误输入
第 3 周 终端、路径、虚拟环境、Git 建仓库、分支、冲突解决 5 次有意义提交和 README
第 4 周 HTTP、JSON、API、环境变量 请求公开 API、处理分页和失败 不泄露密钥的数据采集器
第 5 周 SQL 查询、聚合、JOIN、CTE 用户—订单—商品三表分析 10 条带业务问题的查询
第 6 周 NumPy、pandas、数据清洗 缺失、重复、异常与类型修复 可重复运行的清洗脚本
第 7 周 可视化、测试、日志 画分布和趋势,写单元测试 4 张有结论的图和测试报告
第 8 周 综合项目与复现 从新目录重新安装和运行 数据报告、代码、README

每天怎么学

工作日每次安排 90 分钟:前 20 分钟复习和阅读,接着 50 分钟写代码,最后 20 分钟写注释、测试和问题记录。周末用 3–4 小时完成整合项目。遇到报错先读错误堆栈、缩小输入、打印中间结果,再查文档;不要把整段代码直接交给 AI 修改而不理解差异。

第 8 周项目目录建议

data-project/
├── README.md
├── requirements.txt
├── .env.example
├── data/raw/           # 原始样例,不放敏感数据
├── data/processed/
├── src/fetch.py
├── src/clean.py
├── src/analyze.py
├── tests/
└── reports/

八、阶段项目与检查表

建议做“公开数据分析器”:从 API 或 CSV 获取数据,写入 SQLite/PostgreSQL,完成清洗与 SQL 分析,生成图表和 Markdown 报告。

进入下一阶段前确认:

  • 能从空目录建立虚拟环境和项目结构;
  • 能拆分函数、处理异常并写至少几个测试;
  • 能用 Git 找到自己改了什么;
  • 能解释数据字段、缺失、重复和时间范围;
  • 能用 SQL 与 pandas 得到一致的核心统计;
  • README 能让别人运行,而不是只在自己的电脑上成功。

如果这些检查仍有两项以上依赖照抄教程,先回到专题总路线图缩小练习范围;完成后进入机器学习与深度学习阶段。

实测与内容说明

实测记录

  • 学习内容按通用 AI 工程任务筛选,并非完整的计算机科学课程。
  • 工具命令会随操作系统和版本变化,应以对应官方文档为准。

参考资料

内容版本 1.1 · 审核:站点编辑 · 计划复审:2027-04-04