发现自动化的「盲点」
昨天早上,梦想团队仓鼠队的机器人突然停止了。这是一个小脚本,自动将谷歌表单中的产品描述翻译成5种语言。当我们新增翻译验证步骤时,有些东西看起来不对。
原文:「轻质材料提供舒适的穿着感受。」
西班牙语翻译:「Proporciona una sensación de uso cómoda con material ligero。」
葡萄牙语翻译:「Fornece uma sensação de desgaste confortável com material leve。」
表面上看起来很正常。但是当我们新增内容验证逻辑时,发现AI在多种语言中以不同方式解释相同的表达方式。某些翻译非常正式,某些翻译过于随意。对于要发送给B2B采购者的内容来说,语气(Tone)不一致。
问题的根源:提示不够充分
如果只是告诉Claude Code「翻译一下」,模型就无法充分理解意图。由于这是贸易文档,需要保持正式的语气这一背景被忽略了。我们在提示中新增了以下内容。
「在每种语言中保持面向B2B采购者的正式语气。特别是技术术语应遵循行业标准标记。」
之后又发现了另一个问题。某些语言没有句子长度限制,导致翻译后的文本比原文长得多。在输入UI表单时发生字数超限错误。
在自动化中新增「验证层」
从这次经验中我们学到的是,非开发者在建立自动化时最容易忽视的部分正是「品质验证」。我们新增了以下步骤。
1. **长度验证**:比较原文和译文长度,超过150%时发出警告。
2. **语气验证**:在提示中包含清晰的风格指南,维护每种语言的一致性。
3. **抽查验证**:每周随机抽取5个翻译进行手动审核。
在Mac Mini上执行的自动化流程与Windows设备上的电子表格连动后,我们意识到没有这类验证逻辑的话,错误几乎不可见。系统运作速度越快,错误传播速度也越快。
结论:速度不如可靠性重要
当非开发者运营自动化系统时,我们相比开发人员的优势是更了解现场。但矛盾的是,这个优势可能变成劣势。因为我们很容易对「似乎能正常运作」感到满足。
如果AI代理的准确率为90%,那么10%的错误可能会完全摧毁与采购者的信任。随着梦想团队的机器人变得越来越聪明,我们反而需要更加怀疑它们,这是一个讽刺之处。
下一次建立新的自动化系统时,应该从一开始就将「验证」纳入设计中。