这个玩法能做什么?
以前想批量抓取网站数据,要么手写 Python 爬虫,要么装八爪鱼、后羿采集器之类的工具——门槛高、不灵活。现在用 Codex + Proxyman 抓包,只需告诉 Codex 数据规律,它就能自动写出完整爬虫脚本,一次抓完所有数据并导出 Excel。
整个过程不到 20 分钟,零代码基础也能上手。
第一步:安装 Proxyman 并开启抓包
Proxyman 是一款 macOS 上的免费抓包工具(Windows 可用 Fiddler 或 Charles 替代),它能帮你查看网页的真实请求。
- 下载并安装 Proxyman:https://proxyman.io
- 打开 Proxyman,点击 Enable Proxy 开始监听
- 在浏览器中打开目标网站(例如豆瓣电影榜单:https://ssr1.scrape.center)
- 点击任意一页,在 Proxyman 右侧查看请求详情
第二步:找出请求规律
在 Proxyman 中,你会看到网页的 HTTP 请求。重点关注:
- URL 变化规律:翻页时 URL 尾部变化(如
/page/2、/page/3) - 详情页规律:点击某部电影进入详情页,URL 变为
/detail/1、/detail/2 - 请求头:复制完整的 Request Header,后面会让 Codex 用
把列表页和详情页的请求分别复制到两个文件里:
列表页请求.py
详情页请求.py
第三步:让 Codex 写爬虫脚本
新建一个文件夹,把两个请求文件放进去,然后用 Codex 打开这个项目。
输入以下提示词:
我需要完成一个数据抓取任务:
1. 列表页请求文件是 列表页请求.py,详情页请求文件是 详情页请求.py
2. 列表页规律:URL 尾部加 /page/数字,如 /page/1、/page/2
3. 详情页规律:URL 尾部加 /detail/数字,如 /detail/1、/detail/2
4. 请抓取所有电影的标题、评分、类型、上映日期、简介
5. 最终数据导出为 Excel 文件
Codex 会自动: - 读取你的请求文件 - 分析 HTML 结构,提取目标数据 - 写出完整的爬虫脚本 - 运行并保存结果
第四步:处理 Codex 遇到的坑
Codex 写爬虫时可能会遇到这些问题,直接让它修:
问题 1:编码错误
Traceback: UnicodeDecodeError
→ 提示 Codex:在 open() 函数里加上 encoding='utf-8'
问题 2:响应是 HTML 不是 JSON
response.json() 报错
→ 提示 Codex:用 BeautifulSoup 解析 HTML,提取表格数据
问题 3:翻页抓不全
只抓到第 1 页的数据
→ 提示 Codex:用循环抓取前 10 页,每页间隔 1 秒
第五步:导出并验证结果
Codex 运行完成后,检查生成的 Excel 文件:
- 打开文件,确认字段齐全(标题、评分、类型、上映日期、简介)
- 检查是否有空行或重复数据
- 如需调整格式,直接告诉 Codex:
把上映日期统一成 YYYY-MM-DD 格式
进阶:用这个模式做任何网站
这套方法可以复制到其他网站:
| 网站类型 | 规律识别 | Codex 提示词要点 |
|---|---|---|
| 电商商品页 | URL 含 SKU 参数 | 提取商品名、价格、库存 |
| 新闻列表页 | 分页规律明显 | 提取标题、发布时间、链接 |
| 社交内容页 | API 接口返回 JSON | 直接调用 API,跳过 HTML 解析 |
为什么要用 Proxyman 而不是直接让 Codex 爬?
直接让 Codex 爬网站,它需要自己写 requests 代码,容易踩坑(反爬、编码、解析失败)。
用 Proxyman 先抓包,你直接把能工作的请求交给 Codex,它只需要改改逻辑就行。成功率从 50% 提升到 95%。
完整提示词模板
项目目录:data_scraper/
包含文件:
- 列表页请求.py (已测试可运行)
- 详情页请求.py (已测试可运行)
任务:
1. 读取两个请求文件,理解请求结构
2. 根据 URL 规律(/page/N 和 /detail/N),循环抓取所有页面
3. 提取以下字段:标题、评分、类型、上映日期、简介
4. 使用 pandas 将数据整理成 DataFrame
5. 导出为 result.xlsx,保存在当前目录
6. 打印抓取条数确认完成
注意:每页间隔 2 秒,避免被封。
来源
本文根据稀土掘金作者 JIM CARREY《零代码用Codex实现网页数据抓取》及 CSDN 相关实战内容整理改写。Proxyman 官方文档:https://proxyman.io
资料最后核对日期:2026-09-08 · 内容整理自 CodexGuide 社区公开教程