实战

用 Codex 写爬虫脚本:Proxyman 抓包 + Python 数据抓取实战

2026/9/84 分钟阅读

这个玩法能做什么?

以前想批量抓取网站数据,要么手写 Python 爬虫,要么装八爪鱼、后羿采集器之类的工具——门槛高、不灵活。现在用 Codex + Proxyman 抓包,只需告诉 Codex 数据规律,它就能自动写出完整爬虫脚本,一次抓完所有数据并导出 Excel

整个过程不到 20 分钟,零代码基础也能上手。


第一步:安装 Proxyman 并开启抓包

Proxyman 是一款 macOS 上的免费抓包工具(Windows 可用 Fiddler 或 Charles 替代),它能帮你查看网页的真实请求。

  1. 下载并安装 Proxyman:https://proxyman.io
  2. 打开 Proxyman,点击 Enable Proxy 开始监听
  3. 在浏览器中打开目标网站(例如豆瓣电影榜单:https://ssr1.scrape.center)
  4. 点击任意一页,在 Proxyman 右侧查看请求详情

第二步:找出请求规律

在 Proxyman 中,你会看到网页的 HTTP 请求。重点关注:

  • URL 变化规律:翻页时 URL 尾部变化(如 /page/2/page/3
  • 详情页规律:点击某部电影进入详情页,URL 变为 /detail/1/detail/2
  • 请求头:复制完整的 Request Header,后面会让 Codex 用

把列表页和详情页的请求分别复制到两个文件里:

列表页请求.py
详情页请求.py

第三步:让 Codex 写爬虫脚本

新建一个文件夹,把两个请求文件放进去,然后用 Codex 打开这个项目。

输入以下提示词:

我需要完成一个数据抓取任务:
1. 列表页请求文件是 列表页请求.py,详情页请求文件是 详情页请求.py
2. 列表页规律:URL 尾部加 /page/数字,如 /page/1、/page/2
3. 详情页规律:URL 尾部加 /detail/数字,如 /detail/1、/detail/2
4. 请抓取所有电影的标题、评分、类型、上映日期、简介
5. 最终数据导出为 Excel 文件

Codex 会自动: - 读取你的请求文件 - 分析 HTML 结构,提取目标数据 - 写出完整的爬虫脚本 - 运行并保存结果


第四步:处理 Codex 遇到的坑

Codex 写爬虫时可能会遇到这些问题,直接让它修:

问题 1:编码错误

Traceback: UnicodeDecodeError

→ 提示 Codex:在 open() 函数里加上 encoding='utf-8'

问题 2:响应是 HTML 不是 JSON

response.json() 报错

→ 提示 Codex:用 BeautifulSoup 解析 HTML,提取表格数据

问题 3:翻页抓不全

只抓到第 1 页的数据

→ 提示 Codex:用循环抓取前 10 页,每页间隔 1 秒


第五步:导出并验证结果

Codex 运行完成后,检查生成的 Excel 文件:

  1. 打开文件,确认字段齐全(标题、评分、类型、上映日期、简介)
  2. 检查是否有空行或重复数据
  3. 如需调整格式,直接告诉 Codex:把上映日期统一成 YYYY-MM-DD 格式

进阶:用这个模式做任何网站

这套方法可以复制到其他网站:

网站类型 规律识别 Codex 提示词要点
电商商品页 URL 含 SKU 参数 提取商品名、价格、库存
新闻列表页 分页规律明显 提取标题、发布时间、链接
社交内容页 API 接口返回 JSON 直接调用 API,跳过 HTML 解析

为什么要用 Proxyman 而不是直接让 Codex 爬?

直接让 Codex 爬网站,它需要自己写 requests 代码,容易踩坑(反爬、编码、解析失败)。

用 Proxyman 先抓包,你直接把能工作的请求交给 Codex,它只需要改改逻辑就行。成功率从 50% 提升到 95%


完整提示词模板

项目目录:data_scraper/
包含文件:
- 列表页请求.py (已测试可运行)
- 详情页请求.py (已测试可运行)

任务:
1. 读取两个请求文件,理解请求结构
2. 根据 URL 规律(/page/N 和 /detail/N),循环抓取所有页面
3. 提取以下字段:标题、评分、类型、上映日期、简介
4. 使用 pandas 将数据整理成 DataFrame
5. 导出为 result.xlsx,保存在当前目录
6. 打印抓取条数确认完成

注意:每页间隔 2 秒,避免被封。

来源

本文根据稀土掘金作者 JIM CARREY《零代码用Codex实现网页数据抓取》及 CSDN 相关实战内容整理改写。Proxyman 官方文档:https://proxyman.io

资料最后核对日期:2026-09-08 · 内容整理自 CodexGuide 社区公开教程