这一阶段的目标不是“学完 Python”,而是获得完成 AI 项目所需的最低工程自主性:能拿到数据、写成程序、定位错误、保存版本,并让别人复现。
一、Python 学到什么程度才够用
先掌握变量、字符串、列表、字典、集合、条件、循环、函数、模块、文件和异常。随后补类与对象、迭代器、生成器、上下文管理、类型提示和测试。元类、复杂装饰器和解释器内部原理暂时不是门槛。
练习不要停留在算法小题。写三个小工具:批量整理文件、请求一个公开 API 并保存 JSON、读取 CSV 后生成统计报告。每个工具都应有参数、错误提示和 README。
建议材料:先完成 Python 官方教程,不懂的标准库再按需查阅;把官方示例改成自己的数据,而不是原样复制。
二、命令行与环境管理
你需要理解当前目录、相对路径、环境变量、进程、端口和权限;会使用 cd、ls、pwd、mkdir、cp、mv、grep 或 rg、管道和重定向。Python 项目至少使用虚拟环境并固定依赖。
完成标准是能解释:程序从哪个目录启动、配置从哪里读取、依赖安装到哪里、端口为什么冲突、日志为何没有写到预期位置。很多“AI 问题”实际是路径、编码、依赖或网络问题。
三、Git 不是上传代码按钮
学习仓库、工作区、暂存区、提交、分支、合并和远程仓库。日常最低动作包括查看差异、只提交相关文件、写清提交信息、解决简单冲突,以及用 .gitignore 排除密钥和大文件。
推荐阅读 Pro Git 的入门、分支和远程章节。验收任务是把数据处理项目放入 Git:至少保留三次有意义的提交,并从一个新目录按 README 恢复运行。
四、SQL 与数据思维
模型之前先有数据。SQL 需要掌握 SELECT、过滤、排序、聚合、JOIN、子查询、CTE 和窗口函数;同时理解主键、唯一约束、空值、索引和事务的基本作用。
用一个包含用户、订单和商品的三表数据集练习:计算月度收入、复购率、用户最近一次行为,并输出可用于训练的特征表。重点不是语法花样,而是口径是否明确、连接是否产生重复、时间字段是否泄漏未来信息。
五、NumPy、pandas 与可视化
NumPy 重点是数组形状、索引、广播、向量化和随机数;pandas 重点是读取、类型、缺失值、去重、连接、分组、时间序列和导出。可视化至少会画分布、类别对比、趋势和相关关系,并为图表写一句结论。
每次分析必须保留数据字典:一行代表什么、字段来自哪里、单位是什么、缺失意味着什么。没有这些定义,再漂亮的图和再高的分数也可能建立在错误口径上。
六、HTTP 与 API 基础
理解 URL、请求方法、状态码、Header、JSON、超时和鉴权。能用 Python 请求接口,处理分页、限流、错误响应和重试。不要把 API Key 写进代码;从环境变量读取,并提供 .env.example。
这个能力会直接用于模型 API、数据源、在线推理和项目部署。此时不必先学完整前端,但要能通过命令行或简单页面调用自己的服务。
七、8 周逐步学习计划
| 周次 | 必学内容 | 当周练习 | 验收产物 |
|---|---|---|---|
| 第 1 周 | 变量、类型、条件、循环、函数 | 猜数、记账、文本统计 | 3 个可从命令行运行的脚本 |
| 第 2 周 | 列表、字典、文件、异常、模块 | 批量改名、日志分析 | 拆分模块并处理错误输入 |
| 第 3 周 | 终端、路径、虚拟环境、Git | 建仓库、分支、冲突解决 | 5 次有意义提交和 README |
| 第 4 周 | HTTP、JSON、API、环境变量 | 请求公开 API、处理分页和失败 | 不泄露密钥的数据采集器 |
| 第 5 周 | SQL 查询、聚合、JOIN、CTE | 用户—订单—商品三表分析 | 10 条带业务问题的查询 |
| 第 6 周 | NumPy、pandas、数据清洗 | 缺失、重复、异常与类型修复 | 可重复运行的清洗脚本 |
| 第 7 周 | 可视化、测试、日志 | 画分布和趋势,写单元测试 | 4 张有结论的图和测试报告 |
| 第 8 周 | 综合项目与复现 | 从新目录重新安装和运行 | 数据报告、代码、README |
每天怎么学
工作日每次安排 90 分钟:前 20 分钟复习和阅读,接着 50 分钟写代码,最后 20 分钟写注释、测试和问题记录。周末用 3–4 小时完成整合项目。遇到报错先读错误堆栈、缩小输入、打印中间结果,再查文档;不要把整段代码直接交给 AI 修改而不理解差异。
第 8 周项目目录建议
data-project/
├── README.md
├── requirements.txt
├── .env.example
├── data/raw/ # 原始样例,不放敏感数据
├── data/processed/
├── src/fetch.py
├── src/clean.py
├── src/analyze.py
├── tests/
└── reports/
八、阶段项目与检查表
建议做“公开数据分析器”:从 API 或 CSV 获取数据,写入 SQLite/PostgreSQL,完成清洗与 SQL 分析,生成图表和 Markdown 报告。
进入下一阶段前确认:
- 能从空目录建立虚拟环境和项目结构;
- 能拆分函数、处理异常并写至少几个测试;
- 能用 Git 找到自己改了什么;
- 能解释数据字段、缺失、重复和时间范围;
- 能用 SQL 与 pandas 得到一致的核心统计;
- README 能让别人运行,而不是只在自己的电脑上成功。
如果这些检查仍有两项以上依赖照抄教程,先回到专题总路线图缩小练习范围;完成后进入机器学习与深度学习阶段。