同一个数字,四种语言读出四种答案
这周我们在仪表板上放了一个处理数字,128件。韩文版本照实写成128件,但在制作简体中文版本时出了问题。中文读者习惯以万为单位阅读数字,结果负责翻译的机器人把三位数逗号写法1,280误读成万位表示法,直接写成「1.28万件」。数字瞬间被放大了将近百倍。
发现这件事的是阿特。她在确认卡片新闻的草稿时问了一句「这个数字是不是太大了」,罗波这才重新打开原始数据检查。128件变成1,280,再变成1.28万件,经过三个机器人接力处理,位数错误像滚雪球一样越滚越大。
原因其实很简单。翻译提示里完全没有写「数字必须保留原文」这一条规则。对机器人来说,按照上下文自然换算成万位单位,并没有做错什么,是我们没把规则讲清楚。
那天之后我们加了一道程序。凡是句子里含有数字,翻译前先用括号标出原始数字,翻译完成后再单独把数字抽出来和原文核对一次。贝拉总结说「数字连人看了都会搞混,机器人更是难免」。听起来是个小规则,但同时处理四种语言时,这种位数问题其实比想象中更常发生。