問題:手寫地址堆積如山
某些國家的買家會將訂單拍照後透過電子郵件發送。特別是小型家族企業或不熟悉線上流程的負責人更是如此。照片中混雜著手寫的配送地址、聯絡方式和特殊需求。
我們每月收到200至300張這樣的掃描影像。團隊成員需要逐一用眼睛閱讀並手動輸入Google表單,每週需花費40小時。輸入錯誤的風險也很高,當筆跡模糊時還需多次確認。
「有沒有辦法自動化這個重複工作呢」
想法:Claude的視覺功能
在用Claude Code撰寫指令時,我們發現了Vision API。這意味著可以讀取影像檔案並自動識別其中的文字。
首先進行了小規模實驗。我們上傳買家發送的5張訂單照片到Claude,並提問「你能否從這些影像中提取配送地址和聯絡方式」。結果相當清晰。無論手寫字跡有多潦草,它都能透過文脈和結構進行準確辨識。
「那麼,我們能否將其製成自動化反覆執行的機器人呢」
實施:在Windows設備上30分鐘完成
我們在Windows設備上打開Claude Code並編寫了簡單的工作流程。
步驟1. 監視Google雲端硬碟中的影像
當特定資料夾(「Incoming Orders」)中有影像進入時觸發偵測。
步驟2. 使用Claude Vision進行文字提取
with open(image_path, 'rb') as f:
image_data = base64.b64encode(f.read()).decode()
response = client.messages.create(
model='claude-3-5-sonnet-20241022',
max_tokens=1024,
messages=[{
'role': 'user',
'content': [
{'type': 'image', 'source': {'type': 'base64', 'media_type': 'image/jpeg', 'data': image_data}},
{'type': 'text', 'text': '請從訂單單據中提取配送地址、收貨人姓名和聯絡電話。如果手寫字跡模糊,請根據上下文進行修正。'}
]
}]
)
步驟3. 自動填入Google表單
Claude提取的資訊直接輸入到Google表單的行中。
步驟4. 設定處理完成標記
已處理的影像被移至另一個資料夾(「Processed」),以防止重複處理。
結果:每月節省150小時
機器人開始運營的第一週就看到了明顯的變化。
之前(人工作業)
• 每張影像平均30分鐘(含手寫字跡確認)
• 每月200張 × 30分鐘 = 100小時
• 錯誤重做時間10至15小時
• 每月共110至115小時
之後(機器人運營)
• 每張影像3秒(Claude處理時間)
• 每月200張 × 3秒 = 10分鐘
• 驗證工作30分鐘(僅抽樣檢查)
• 每月共1小時
節省時間每月超過110小時。團隊成員可將相同時間投入更高價值的工作,例如買家溝通和品質管理。
意外的發現
1. 手寫字跡反而更準確
手寫具有高度個人化特徵。而Claude能讀取這種文脈意涵。例如,若是航運公司的地址筆跡,它會優先識別港口或碼頭名稱。與印刷表單不同,手寫字體反而提供了更多推理空間,提升了準確性。
2. 同時擷取備註和特殊需求
照片邊緣常會出現「Fragile」等英文標記、特定時間配送限制或通關相關指示。人工作業容易遺漏這些,但調整Claude的提示詞後,這些資訊也一併被提取了。
3. 自動分類語言混合內容
同一訂單單據中可能混用韓文、英文和中文。Claude會自動辨別各語言並輸入至相應欄位。
下一步計劃
目前僅處理靜態影像。下一階段計劃支援PDF訂單單據。此外,我們也正在改進信心分數記錄機制,將0.7以下的項目轉入手動驗證隊列。
「當小型重複工作不斷累積時,Claude Code的視覺功能是比預期更強大的工具。」
非開發人員也能充分著手。首個機器人規模小,成果卻很顯著。