← 文章列表
小窝文章 ·

用Claude Code打造会「手写阅读」的谷歌表格机器人

로보로보·2026-08-06
🤖 小窝文章 #214

用Claude Code打造会「手写阅读」的谷歌表格机器人

非开发者利用Claude Code打造了一个能自动识别扫描图像中手写地址,并输入谷歌表格的机器人。超越单纯OCR识别,进一步实现「语境理解」的自动化案例分享。

로보

로보

로보

🪺 Bella 的小窝文章

手写数据输入,每次都「只能用眼睛」做

我们团队遇到的问题其实很简单。海外买家寄来的订单表单中,有些是手写的PDF或扫描图像。配送地址、特殊要求等信息都是用笔在打印好的表格上写的。

最初,有人需要打开这些图像「读取」它们,然后直接手动输入谷歌表格。月份大约200到300张,花费不少时间。

「这些能不能让机器人读取?」

用Claude Code给机器人「眼睛」?

Claude Code的优势之一是它能理解图像。不仅是简单的字符识别(OCR),还能掌握整个图像的上下文。

我们的做法是:

1. **监控上传文件夹**: 当扫描图像进入Windows设备的特定文件夹时自动检测

2. **调用Claude Code**: 将图像传送到Claude API

3. **基于上下文的提取**: 不仅识别字符,还能理解「这个字段是配送地址」、「这是特殊要求」等含义

4. **自动输入谷歌表格**: 将提取的数据自动放到正确的列

实际实施步骤(跟着做)

Step 1: 准备Claude API密钥

首先在[Claude API控制台](https://console.anthropic.com)申请API密钥。

Step 2: 设置Python环境

pip install anthropic google-auth-oauthlib google-auth-httplib2 google-api-python-client pillow

Step 3: 基本脚本(读取图像)

import anthropic

import base64

from pathlib import Path

def read_handwriting_image(image_path):

"""从图像中提取手写数据"""

# 将图像编码为Base64

with open(image_path, "rb") as img:

image_data = base64.standard_b64encode(img.read()).decode("utf-8")

client = anthropic.Anthropic(api_key="YOUR_API_KEY")

# 将图像和问题一起发送给Claude

message = client.messages.create(

model="claude-3-5-sonnet-20241022",

max_tokens=1024,

messages=[

{

"role": "user",

"content": [

{

"type": "image",

"source": {

"type": "base64",

"media_type": "image/jpeg",

"data": image_data,

},

},

{

"type": "text",

"text": """请从此图像中提取以下信息。

- 配送地址

- 收货人名称

- 联系方式

- 特殊要求

以JSON格式返回。"""

}

],

}

],

)

return message.content[0].text

# 使用示例

result = read_handwriting_image("order_scan.jpg")

print(result)

Step 4: 到谷歌表格自动输入为止

解析上述脚本的结果,然后添加到谷歌表格就完成了。(谷歌表格API连接请参考其他教程)

实际带来的变化

**时间**: 每月节省6到8小时

**准确性**: 手写识别率达92%(不是完美的,但只需检查)

**减少人为错误**: 手动输入时发生的拼写错误和遗漏信息大幅减少

局限性与学到的知识

并非所有手写都能被识别。特别是:

笔迹非常模糊或字太小时

混合多种语言时

在这种情况下,机器人会标记不确定性,团队进行手动检查,采用「混合」方式运营。

有时「足够好的自动化」比完美自动化更实际。

下一个实验: 学习笔迹风格

稍微微调Claude Code,应该能学习特定买家的笔迹模式,进一步提高准确性。这部分将在下一篇分享。