问题:手写地址堆积如山
某些国家的买家会将订单拍照后通过电子邮件发送。特别是小型家族企业或不熟悉在线流程的负责人更是如此。照片中混杂着手写的配送地址、联系方式和特殊需求。
我们每月收到200至300张这样的扫描图像。团队成员需要逐一用眼睛阅读并手动输入Google表单,每周需花费40小时。输入错误的风险也很高,当笔迹模糊时还需多次确认。
「有没有办法自动化这个重复工作呢」
想法:Claude的视觉功能
在用Claude Code撰写脚本时,我们发现了Vision API。这意味着可以读取图像文件并自动识别其中的文字。
首先进行了小规模实验。我们上传买家发送的5张订单照片到Claude,并提问「你能否从这些图像中提取配送地址和联系方式」。结果相当清晰。无论手写字迹有多潦草,它都能通过文脉和结构进行准确辨识。
「那么,我们能否将其制成自动化重复执行的机器人呢」
实施:在Windows设备上30分钟完成
我们在Windows设备上打开Claude Code并编写了简单的工作流程。
步骤1. 监视Google云端硬盘中的图像
当特定文件夹(「Incoming Orders」)中有图像进入时触发侦测。
步骤2. 使用Claude Vision进行文字提取
with open(image_path, 'rb') as f:
image_data = base64.b64encode(f.read()).decode()
response = client.messages.create(
model='claude-3-5-sonnet-20241022',
max_tokens=1024,
messages=[{
'role': 'user',
'content': [
{'type': 'image', 'source': {'type': 'base64', 'media_type': 'image/jpeg', 'data': image_data}},
{'type': 'text', 'text': '请从订单单据中提取配送地址、收货人姓名和联系电话。如果手写字迹模糊,请根据上下文进行修正。'}
]
}]
)
步骤3. 自动填入Google表单
Claude提取的信息直接输入到Google表单的行中。
步骤4. 设定处理完成标记
已处理的图像被移至另一个文件夹(「Processed」),以防止重复处理。
结果:每月节省150小时
机器人开始运营的第一周就看到了明显的变化。
之前(人工作业)
• 每张图像平均30分钟(含手写字迹确认)
• 每月200张 × 30分钟 = 100小时
• 错误重做时间10至15小时
• 每月共110至115小时
之后(机器人运营)
• 每张图像3秒(Claude处理时间)
• 每月200张 × 3秒 = 10分钟
• 验证工作30分钟(仅抽样检查)
• 每月共1小时
节省时间每月超过110小时。团队成员可将相同时间投入更高价值的工作,例如买家沟通和品质管理。
意外的发现
1. 手写字迹反而更准确
手写具有高度个人化特征。而Claude能读取这种文脉含义。例如,若是航运公司的地址笔迹,它会优先识别港口或码头名称。与印刷表单不同,手写字体反而提供了更多推理空间,提升了准确性。
2. 同时截取备注和特殊需求
照片边缘常会出现「Fragile」等英文标记、特定时间配送限制或通关相关指示。人工作业容易遗漏这些,但调整Claude的提示词后,这些信息也一并被提取了。
3. 自动分类语言混合内容
同一订单单据中可能混用韩文、英文和中文。Claude会自动辨别各语言并输入至相应栏位。
下一步计划
目前仅处理静态图像。下一阶段计划支持PDF订单单据。此外,我们也正在改进信心分数记录机制,将0.7以下的项目转入手动验证队列。
「当小型重复工作不断累积时,Claude Code的视觉功能是比预期更强大的工具。」
非开发人员也能充分着手。首个机器人规模小,成果却很显著。