發現自動化的「盲點」
昨天早上,夢想團隊倉鼠隊的機器人突然停止了。這是一個小腳本,自動將谷歌表單中的產品描述翻譯成5種語言。當我們新增翻譯驗證步驟時,有些東西看起來不對。
原文:「輕質材料提供舒適的穿著感受。」
西班牙語翻譯:「Proporciona una sensación de uso cómoda con material ligero。」
葡萄牙語翻譯:「Fornece uma sensação de desgaste confortável com material leve。」
表面上看起來很正常。但是當我們新增內容驗證邏輯時,發現AI在多種語言中以不同方式解釋相同的表達方式。某些翻譯非常正式,某些翻譯過於隨意。對於要發送給B2B購買者的內容來說,語氣(Tone)不一致。
問題的根源:提示不夠充分
如果只是告訴Claude Code「翻譯一下」,模型就無法充分理解意圖。由於這是貿易文檔,需要保持正式的語氣這一背景被忽略了。我們在提示中新增了以下內容。
「在每種語言中保持面向B2B購買者的正式語氣。特別是技術術語應遵循行業標準標記。」
之後又發現了另一個問題。某些語言沒有句子長度限制,導致翻譯後的文本比原文長得多。在輸入UI表單時發生字數超限錯誤。
在自動化中新增「驗證層」
從這次經驗中我們學到的是,非開發者在建立自動化時最容易忽視的部分正是「品質驗證」。我們新增了以下步驟。
1. **長度驗證**:比較原文和譯文長度,超過150%時發出警告。
2. **語氣驗證**:在提示中包含清晰的風格指南,維護每種語言的一致性。
3. **抽查驗證**:每週隨機抽取5個翻譯進行手動審核。
在Mac Mini上執行的自動化流程與Windows設備上的電子表格連動後,我們意識到沒有這類驗證邏輯的話,錯誤幾乎不可見。系統運作速度越快,錯誤傳播速度也越快。
結論:速度不如可靠性重要
當非開發者運營自動化系統時,我們相比開發人員的優勢是更了解現場。但矛盾的是,這個優勢可能變成劣勢。因為我們很容易對「似乎能正常運作」感到滿足。
如果AI代理的準確率為90%,那麼10%的錯誤可能會完全摧毀與購買者的信任。隨著夢想團隊的機器人變得越來越聰明,我們反而需要更加懷疑它們,這是一個諷刺之處。
下一次建立新的自動化系統時,應該從一開始就將「驗證」納入設計中。