实战

37 份合同提字段:用 Codex 把一堆 PDF 变成一张台账

2026/8/64 分钟阅读

这类活最费人,也最适合交出去

行政要从 37 份 PDF 合同里提「违约金比例」,做成一张 Excel。传统做法:逐份打开、Ctrl+F 搜「违约」、找到数字、复制粘贴——37 份保守估计一下午。

财务季度末更狠:几十上百张电子发票,要把开票日期、金额、销售方抠出来填进报销模板。

这类任务的共同点是:规则明确、字段固定、纯体力、但一错就得返工。 正好是 Codex 的主场——它自己写脚本、自己跑、自己把结果汇总成表,你只负责说清楚要什么、然后抽检。

下面这套六步流程,跑一次就能沉淀成你自己的模板。

第一步:把文件归拢,先把名字改干净

新建一个文件夹(比如 contracts/),把所有待处理 PDF 平铺进去,然后检查文件名。

有两类名字会给后面添麻烦:

  • 含中文括号或特殊符号的,如 合同(终版).pdf → 改成 合同_终版.pdf
  • 全是 扫描件1.pdf新建文档.pdf 这种无意义命名——不是不能跑,是出错时你没法快速定位是哪一份

命名统一好之后,在 Codex 里把这个文件夹设为工作区,权限给「自动审查」这一档就够——它只读文件、写新表,不需要完全访问。

第二步:先跑一份,把字段定义谈清楚

别一上来就丢 37 份。 先拿一份最典型的做样板:

读取 contracts/合同_A公司.pdf,
帮我找出「违约金比例」这个信息出现在哪一段,
把原文段落和你识别出的数值一起告诉我,并注明在第几页。
先不要生成表格。

这一步是在对齐口径。你会发现合同里写法五花八门:「按合同总金额的 5%」「日万分之五」「不低于人民币壹万元整」。

看完样板,你才知道字段该怎么定义——是只抓百分比,还是要保留原文?遇到日利率算不算?定义谈拢了,批量才不会返工。

第三步:把字段写成 schema 再批量跑

字段清单要像填表一样具体,每一列都说明白类型和缺失时怎么办:

读取 contracts/ 下所有 PDF,为每一份提取以下字段,
汇总成一张表格导出为 违约金台账.xlsx:

| 列名 | 说明 |
| 文件名 | 原始 PDF 文件名 |
| 签约方 | 甲方全称 |
| 违约金比例 | 只填数值+单位,如 5% 或 日万分之五 |
| 原文摘录 | 该条款所在句子的原文,不超过 50 字 |
| 页码 | 该条款所在页 |
| 生效日期 | 统一格式 YYYY-MM-DD |

规则:
- 找不到的字段填「未找到」,不要猜、不要留空
- 有多处相关表述时,全部列出,用分号隔开
- 处理完告诉我:成功几份、有问题几份,问题分别是什么

三处细节值得注意:要求「原文摘录 + 页码」(出问题能一秒回溯到源头)、明确「找不到就写未找到」(防止 AI 编造)、要一份完成情况汇报(不用自己数)。

第四步:扫描件走 OCR,单独标出来

原生文本层的 PDF 准确率很高,手机拍的、复印扫描的就不一定了。

这批 PDF 里有部分是扫描件,字选不中。
对这类文件请先做文字识别再提取,
并在表格里新增一列「来源类型」,标明是「原生文本」还是「OCR识别」。
OCR 识别的行,另外标注你对结果的把握程度。

低于 150 dpi 的图片页、手写体,漏字是常态。把 OCR 行单独标出来的意义就在这里——抽检时优先查这批,原生文本那批可以少花点力气。

第五步:抽检,这一步不能省

Codex 说「完成了」不等于对。发票金额、合同条款这种东西,错一个数就是事故。

按这三条查:

  1. 随机抽 10% 对着原文件核,重点看数值和日期
  2. 筛「未找到」的行——是真的没有,还是提取逻辑漏了
  3. 看异常值——比例超过 100%、日期在合同签订前,这类一眼可疑

抽检结果不理想也别重来,直接反馈:

第 12 行和第 25 行的违约金比例提错了,
原文分别是「逾期付款按日万分之五计算」和「不超过合同总额的 3%」。
请回头检查所有含「按日」「不超过」表述的条目,重新提取这几类。

第六步:套模板填充,然后固化下来

台账做好了,往往还要填进公司的固定模板(报销单、审批表):

用 报销模板.xlsx 作为格式基准,
把 发票台账.xlsx 里的数据按对应关系填进去,
每 20 条生成一份,文件名为 报销_01.xlsx、报销_02.xlsx 依次编号。
金额列保留两位小数,日期列统一为 YYYY-MM-DD 文本格式。
不要改动模板的表头、公式和格式。

如果这套流程你每个月都要跑一次,最后一步是把它固化:让 Codex 把上面的字段定义、规则、抽检清单写成一个 Skill 或一份 AGENTS.md,下次一句话就能唤起,不用重新组织提示词。

提示词里最值钱的三句话

「找不到就写未找到,不要猜」——这一句能挡掉绝大部分编造。

「附原文摘录和页码」——让结果可回溯,抽检成本降一个数量级。

「完成后汇报成功/失败数量」——你不需要自己数行数找漏网的。

批量提取的准确率上限,取决于你把规则说得有多细。花五分钟写清楚字段定义,比事后花一小时对账划算得多。

来源:公众号《Codex 写代码只是入门,我用它 10 分钟做完了 3 个人的活》与 Codex 文档处理 Skill 实战分享内容,本文为原创转写与流程重构。

资料最后核对日期:2026-08-06 · 内容整理自 CodexGuide 社区公开教程