问题从图像开始
某一天收件箱里开始堆积扫描的订单表格。以 PDF、JPG、PNG 等各种形式出现的图像文件,一份份涌入。手工逐一抄写根本是不可能的任务。
「怎样才能自动化这项工作」的问题浮现在脑海中,平时用 Claude Code 做事的经验似乎能派上用场。
发现 Claude Code 的图像识别功能
Claude Code 不只是一个代码生成工具,它具备图像分析能力。也就是说,它可以直接读取图像文件,并提取其中的文字和数据。
第一次实验很简单。上传一份订单表格样本图像到 Claude Code,问道:「能从这个表格中提取客户名称、数量、特殊要求吗」。
**惊人的结果**:Claude Code 只用了几秒钟就精确识别了图像中的所有字段。连手写字迹也读得相当好。
工作流程设计 (48 小时内完成)
步骤 1:监控输入文件夹
• 监视 Windows 设备特定文件夹中的新图像文件
• 使用脚本 (PowerShell) 每小时检查一次文件夹
步骤 2:将图像传送到 Claude Code
自动化提示词:
「从这份订单表格中提取以下内容:
• 客户名称
• 订单数量
• 配送地址
• 特殊要求
以 JSON 格式返回」
步骤 3:将结果自动输入到 Google 表格
• 接收 Claude Code 的 JSON 回应
• 通过 Apps Script 插入到 Google 表格的下一个空白行
• 同时记录时间戳和原始文件名称
步骤 4:检查通知
• 自动处理完成后,以电邮通知团队
• 需要检查时只需输入一行反馈意见
意外成功的 3 个重点
1. 连手写字也大多能读出来
起初预期只有印刷表格能用,没想到客户手写的字段也有 80% 左右能准确识别。草写能力较弱,但方块字几乎完美。
2. 多语言混合也能处理
部分订单表格混有中文、英文等多种语言。Claude Code 能自动识别并正确提取各种语言的文字。
3. 成本远低于预期
Claude Code 的图像处理采用 token 计费制。使用 token 数量少于预期,所以月度自动化费用非常合理。
实作中遇到的陷阱
陷阱 1:扫描品质不佳时
• 解决方案:加入图像预处理阶段,自动调整亮度
陷阱 2:每份表格的字段顺序不同
• 解决方案:将提示词改为「寻找特定字段名称」(从位置基础改为内容基础)
陷阱 3:部分客户名称遗漏
• 解决方案:自动检测失败时显示手动输入窗口
结果
启动此自动化后,
• 订单表格输入时间:每周 3 小时 → 30 分钟
• 数据输入错误率:4-5% → 0.2%
• 团队对自动化的信任度大幅提升
Claude Code 的图像识别比预想中更实用。这是非开发者完全可以运用的自动化技术。
下一步实验
接下来打算根据这些提取的数据,进一步自动生成回复邮件的工作流程。届时应该会有新的发现。