如何评估一个阿拉伯语原生的 AI 智能体
如今几乎每家面向海湾市场的供应商都声称支持阿拉伯语,但它们所指的并不是同一回事。本指南给出八项测试——如果我们坐在您这一侧的谈判桌前,就会这样测——每一项都能在两分钟内让一个「翻译型聊天机器人」露出破绽。
发布于
为什么「支持阿拉伯语」算不上一项技术规格
一个以英语为绝对主体训练、再被塞进阿拉伯语提示词的模型,确实能产出语法正确的标准阿拉伯语,但读起来像一份政府公文。您的客户不会用标准阿拉伯语给您写消息——他们用沙特、阿联酋或海湾方言,一半用拉丁字母拼写,还会在句子中间夹进英文产品名。
评估之所以出错,正是卡在这道落差上。演示用的是干净的标准阿拉伯语脚本,一切顺畅;等到试点面对真实的 WhatsApp 收件箱,问题才暴露。所以要尽早、反复地把演示推离它的脚本。
测试 1—— 要方言,而不只是阿拉伯语
按您客户真实的书写方式发三条消息:一条沙特方言、一条埃及方言、一条黎凡特方言。真正懂方言的智能体会把三条都答上,既不会把客户拽回标准阿拉伯语,也不会要求对方换个说法。
不要只看回答是否准确,还要看它的语域。用正式的「福斯哈」去回答一个随意的方言问题,说明它听懂了词,却没读懂人。
测试 2—— 同一次会话中的语码转换
先用阿拉伯语开场,接着用英语追问,然后再切回阿拉伯语。智能体必须在这三轮中完整保留上下文,不能重置、不能重复提问,也不能用第一个问题的语言去回答第二个问题。
这是生产环境中最常见的单点失败,因为多数系统把语言实现成「按会话」设置,而不是「按消息」属性。
测试 3—— 阿拉伯语的数字、日期与金额
问一笔「上周四」下的订单,看它按伊斯兰历还是公历解析这个日期——以及它是否说明用的是哪一种。再问一个价格,检查沙特里亚尔在从右至左的句子里是否渲染正确,数字方向是否符合客户预期。
双向文本正是「浅层阿拉伯语支持」最容易露馅的地方:价格被倒置、订单号被拆断,客户还没读完就已经失去信任。
测试 4—— 姓名与音译
在同一段对话中,把同一个名字用两种写法给它——عبدالرحمن 和 Abdulrahman——看它是否认定为同一个人。然后让它把这个名字写回 CRM 字段,看它会选哪一种写法。
跨书写体系的身份归并一点都不光鲜,却直接决定您的 CRM 里最终是一条记录还是两条。
测试 5—— 依据锚定与拒答
问一个您根本不提供的产品档位、折扣或政策。正确的回答是明确的「我们不提供这项」,最好再附上最接近的真实替代方案。如果它在这里编出一个听起来合理的阿拉伯语答案,那它在客户面前也一样会编。
把同一个虚构问题用阿拉伯语和英语各问一遍。有些系统在英语上锚定得很好,在阿拉伯语上却开始幻觉,原因是检索索引当初只用英文文档建过。
测试 6—— 带上下文的升级
强制触发一次升级,然后看人工同事收到的是什么。完整的双语对话记录、已识别的意图,以及客户真正的问题,才算一次可用的交接。一张写着「客户需要帮助」的工单,只是给队列多加了几个步骤。
要专门问清楚:交给人工的摘要,是用人工坐席的工作语言写的,还是用客户的语言写的。
测试 7—— 语音,如果语音在范围内
文字质量说明不了通话质量。让智能体拨打一个手机号,重点听三件事:第一个字出口前的延迟、被打断时的处理方式,以及阿拉伯语的语调听起来像个人还是像导航播报。
然后再问:线路嘈杂时会怎样——因为真实的跟进电话,往往发生在车里。
测试 8—— 对话结束之后它做了什么
对话只是看得见的那一半。请供应商演示写回动作:CRM 记录、ERP 字段、真正发起的那笔退款。并要求在您本来就在用的系统里,看到该动作的审计轨迹。
一个说得漂亮却什么都不写回的智能体,只是把您的问题从收件箱搬到了队列,手工活一点没少。