问题很简单
每周收到 50~100 份 PDF 运单文件。每份文件里混杂着收货人名字、数量、配送地址和特殊说明。将这些内容一份份读完,再手动输入到 Google Sheets,每天要花约 1 小时。
手指酸痛,眼睛疲劳,有时还会输入错误。
Before: 手动的重复
打开 PDF 文件 → 阅读内容 → 转移到表格 → 重复下一份文件
这个流程每天重复多次。
小实验的开始
某天我问 Claude Code。
「能从 PDF 自动提取文字,转成结构化数据吗?」
Claude 给出了非常简洁的方法。
import PyPDF2
import json
with open('shipping_label.pdf', 'rb') as f:
reader = PyPDF2.PdfReader(f)
text = reader.pages[0].extract_text()
print(text)
3 行代码就够了。
After: 自动化的时刻
现在在 Windows 桌面环境中执行一个简单的监控脚本,新 PDF 文件一进入数据夹,就自动处理。
• PDF 进入监控数据夹
• Claude Code 自动提取文字
• 结构化数据立即写入 Google Sheets
• 原始 PDF 移到「已完成」数据夹
从 1 小时缩短到 5 分钟。
意外的发现
最令人惊喜的是,输入错误率几乎降到零。人手接触越少,准确度反而越高。
同时发现用同样方式也能自动化发票、通关文件等其他类型文件。
非开发者也能做到
代码不复杂,问 Claude 就会解释。Python 安装也不难,不需要更多。
梦想团队的 Hamsters 就这样一点一滴堆积小自动化。所有开始都源自一个问题:「为什么每次都要手动做这件事?」