手寫數據輸入,每次都「只能用眼睛」做
我們團隊遇到的問題其實很簡單。海外買家寄來的訂單表單中,有些是手寫的PDF或掃描圖像。配送地址、特殊要求等資訊都是用筆在列印好的表格上寫的。
最初,有人需要打開這些圖像「讀取」它們,然後直接手動輸入Google試算表。月份大約200到300張,花費不少時間。
「這些能不能讓機器人讀取?」
用Claude Code給機器人「眼睛」?
Claude Code的優勢之一是它能理解圖像。不僅是簡單的字符識別(OCR),還能掌握整個圖像的上下文。
我們的做法是:
1. **監控上傳資料夾**: 當掃描圖像進入Windows設備的特定資料夾時自動偵測
2. **呼叫Claude Code**: 將圖像傳送到Claude API
3. **基於上下文的提取**: 不僅識別字符,還能理解「這個欄位是配送地址」、「這是特殊要求」等含義
4. **自動輸入Google試算表**: 將提取的數據自動放到正確的欄位
實際實施步驟(跟著做)
Step 1: 準備Claude API密鑰
首先在[Claude API控制台](https://console.anthropic.com)申請API密鑰。
Step 2: 設定Python環境
pip install anthropic google-auth-oauthlib google-auth-httplib2 google-api-python-client pillow
Step 3: 基本指令碼(讀取圖像)
import anthropic
import base64
from pathlib import Path
def read_handwriting_image(image_path):
"""從圖像中提取手寫數據"""
# 將圖像編碼為Base64
with open(image_path, "rb") as img:
image_data = base64.standard_b64encode(img.read()).decode("utf-8")
client = anthropic.Anthropic(api_key="YOUR_API_KEY")
# 將圖像和問題一起發送給Claude
message = client.messages.create(
model="claude-3-5-sonnet-20241022",
max_tokens=1024,
messages=[
{
"role": "user",
"content": [
{
"type": "image",
"source": {
"type": "base64",
"media_type": "image/jpeg",
"data": image_data,
},
},
{
"type": "text",
"text": """請從此圖像中提取以下信息。
- 配送地址
- 收貨人名稱
- 聯繫方式
- 特殊要求
以JSON格式返回。"""
}
],
}
],
)
return message.content[0].text
# 使用示例
result = read_handwriting_image("order_scan.jpg")
print(result)
Step 4: 到Google試算表自動輸入為止
解析上述指令碼的結果,然後添加到Google試算表就完成了。(Google試算表API連接請參考其他教程)
實際帶來的變化
• **時間**: 每月節省6到8小時
• **準確性**: 手寫識別率達92%(不是完美的,但只需檢查)
• **減少人為錯誤**: 手動輸入時發生的拼寫錯誤和遺漏信息大幅減少
局限性與學到的知識
並非所有手寫都能被識別。特別是:
• 筆跡非常模糊或字太小時
• 混合多種語言時
在這種情況下,機器人會標記不確定性,團隊進行手動檢查,採用「混合」方式運營。
有時「足夠好的自動化」比完美自動化更實際。
下一個實驗: 學習筆跡風格
稍微微調Claude Code,應該能學習特定買家的筆跡模式,進一步提高準確性。這部分將在下一篇分享。