問題從圖像開始
某一天收件匣裡開始堆積掃描的訂單表格。以 PDF、JPG、PNG 等各種形式出現的圖像檔案,一份份湧入。手工逐一抄寫根本是不可能的任務。
「怎樣才能自動化這項工作」的問題浮現在腦海中,平時用 Claude Code 做事的經驗似乎能派上用場。
發現 Claude Code 的圖像辨識功能
Claude Code 不只是一個代碼生成工具,它具備圖像分析能力。也就是說,它可以直接讀取圖像檔案,並提取其中的文字和數據。
第一次實驗很簡單。上傳一份訂單表格樣本圖像到 Claude Code,問道:「能從這個表格中提取客戶名稱、數量、特殊要求嗎」。
**驚人的結果**:Claude Code 只用了幾秒鐘就精確識別了圖像中的所有欄位。連手寫字跡也讀得相當好。
工作流程設計 (48 小時內完成)
步驟 1:監控輸入資料夾
• 監視 Windows 設備特定資料夾中的新圖像檔案
• 使用指令稿 (PowerShell) 每小時檢查一次資料夾
步驟 2:將圖像傳送到 Claude Code
自動化提示詞:
「從這份訂單表格中提取以下內容:
• 客戶名稱
• 訂單數量
• 配送地址
• 特殊要求
以 JSON 格式返回」
步驟 3:將結果自動輸入到 Google 試算表
• 接收 Claude Code 的 JSON 回應
• 透過 Apps Script 插入到 Google 試算表的下一個空白行
• 同時記錄時間戳記和原始檔案名稱
步驟 4:檢查通知
• 自動處理完成後,以電郵通知團隊
• 需要檢查時只需輸入一行反饋意見
意外成功的 3 個重點
1. 連手寫字也大多能讀出來
起初預期只有印刷表格能用,沒想到客戶手寫的欄位也有 80% 左右能準確識別。草寫能力較弱,但方塊字幾乎完美。
2. 多語言混合也能處理
部分訂單表格混有繁體中文、英文和簡體中文。Claude Code 能自動辨識並正確提取各種語言的文字。
3. 成本遠低於預期
Claude Code 的圖像處理採用 token 計費制。使用 token 數量少於預期,所以月度自動化費用非常合理。
實作中遇到的陷阱
陷阱 1:掃描品質不佳時
• 解決方案:加入圖像預處理階段,自動調整亮度
陷阱 2:每份表格的欄位順序不同
• 解決方案:將提示詞改為「尋找特定欄位名稱」(從位置基礎改為內容基礎)
陷阱 3:部分客戶名稱遺漏
• 解決方案:自動偵測失敗時顯示手動輸入視窗
結果
啟動此自動化後,
• 訂單表格輸入時間:每週 3 小時 → 30 分鐘
• 數據輸入錯誤率:4-5% → 0.2%
• 團隊對自動化的信任度大幅提升
Claude Code 的圖像辨識比預想中更實用。這是非開發者完全可以運用的自動化技術。
下一步實驗
接下來打算根據這些提取的數據,進一步自動生成回覆郵件的工作流程。屆時應該會有新的發現。