手写数据输入,每次都「只能用眼睛」做
我们团队遇到的问题其实很简单。海外买家寄来的订单表单中,有些是手写的PDF或扫描图像。配送地址、特殊要求等信息都是用笔在打印好的表格上写的。
最初,有人需要打开这些图像「读取」它们,然后直接手动输入谷歌表格。月份大约200到300张,花费不少时间。
「这些能不能让机器人读取?」
用Claude Code给机器人「眼睛」?
Claude Code的优势之一是它能理解图像。不仅是简单的字符识别(OCR),还能掌握整个图像的上下文。
我们的做法是:
1. **监控上传文件夹**: 当扫描图像进入Windows设备的特定文件夹时自动检测
2. **调用Claude Code**: 将图像传送到Claude API
3. **基于上下文的提取**: 不仅识别字符,还能理解「这个字段是配送地址」、「这是特殊要求」等含义
4. **自动输入谷歌表格**: 将提取的数据自动放到正确的列
实际实施步骤(跟着做)
Step 1: 准备Claude API密钥
首先在[Claude API控制台](https://console.anthropic.com)申请API密钥。
Step 2: 设置Python环境
pip install anthropic google-auth-oauthlib google-auth-httplib2 google-api-python-client pillow
Step 3: 基本脚本(读取图像)
import anthropic
import base64
from pathlib import Path
def read_handwriting_image(image_path):
"""从图像中提取手写数据"""
# 将图像编码为Base64
with open(image_path, "rb") as img:
image_data = base64.standard_b64encode(img.read()).decode("utf-8")
client = anthropic.Anthropic(api_key="YOUR_API_KEY")
# 将图像和问题一起发送给Claude
message = client.messages.create(
model="claude-3-5-sonnet-20241022",
max_tokens=1024,
messages=[
{
"role": "user",
"content": [
{
"type": "image",
"source": {
"type": "base64",
"media_type": "image/jpeg",
"data": image_data,
},
},
{
"type": "text",
"text": """请从此图像中提取以下信息。
- 配送地址
- 收货人名称
- 联系方式
- 特殊要求
以JSON格式返回。"""
}
],
}
],
)
return message.content[0].text
# 使用示例
result = read_handwriting_image("order_scan.jpg")
print(result)
Step 4: 到谷歌表格自动输入为止
解析上述脚本的结果,然后添加到谷歌表格就完成了。(谷歌表格API连接请参考其他教程)
实际带来的变化
• **时间**: 每月节省6到8小时
• **准确性**: 手写识别率达92%(不是完美的,但只需检查)
• **减少人为错误**: 手动输入时发生的拼写错误和遗漏信息大幅减少
局限性与学到的知识
并非所有手写都能被识别。特别是:
• 笔迹非常模糊或字太小时
• 混合多种语言时
在这种情况下,机器人会标记不确定性,团队进行手动检查,采用「混合」方式运营。
有时「足够好的自动化」比完美自动化更实际。
下一个实验: 学习笔迹风格
稍微微调Claude Code,应该能学习特定买家的笔迹模式,进一步提高准确性。这部分将在下一篇分享。