DeepL AI Labs
人工智能翻译的问题在于,即使翻译并不完美,看起来却依然完美无缺。由于错误乍看之下并不明显,你只能相信人工智能模型的说法,认为一切都正确无误。唯一的替代方案是请语言专家逐行审查译文,查找错误、遗漏以及非专家极易忽略的细微语义变化。
这种无休止的核查要求,正是本地化团队对 人工智能 翻译最常见的抱怨之一。这为所有从事语言人工智能研究的人提出了一个根本性问题。机器翻译如何才能赢得依赖它的组织的信任?如何才能避免让人类审阅人仅仅为了“确认无误”而重复检查机器翻译已经完成的工作?
事实证明,人工智能能够解决这个问题,但不能通过最初生成该翻译的同一人工智能模型来实现。质量测试表明,当大型语言模型(LLMs)检查翻译结果时,它们往往偏袒自身模型的产出,从而忽略了其潜在的缺陷。在人工智能领域,若让模型自行检查自己的“作业”,是无法赢得信任的。然而,通过构建并训练一个完全专注于识别潜在错误或语义偏差的独立模型,便能赢得这种信任。
这正是 DeepL 的高级产品经理玛尔塔·丹尼连科(Marta Danylenko)、高级研究科学家马丁·伯格(Martin Berger)以及我们翻译质量评估工具背后的团队一直在做的事情。他们开发了一个独立的TQE人工智能模型,其唯一目的是:对翻译进行压力测试,并归类出用户应知晓的任何错误或潜在错误。
TQE 的专家级人工智能编辑会逐段审查译文,并将源文本与译文并排显示。在单独的一栏中,它会突出显示翻译中的任何潜在问题,并按严重程度分为“严重”、“重大”或“轻微”三类。人工审阅人可以跳转到每个潜在问题,审查该段落,直接编辑翻译内容,标记为已解决,或者直接忽略该标记。
这引发了一个显而易见的问题,也是玛尔塔和马丁经常被问到的问题: 既然TQE知道存在错误,为什么不能直接修正呢?为什么还要让人工审阅人参与进来呢?原因归根结底在于错误本身的性质。而这正是人工智能(AI)本质所直接导致的。
人工智能模型本质上是概率性的。它们能以惊人的准确度做出高度汇总的统计推测,但这些终究只是最佳推测——有时也会出错。当关键上下文缺失时,这种可能性就会增加。另一个模型可以发现这种偏差和潜在的歧义,但若不进行另一次推测,便无法加以修正。此时,让人类介入才是更好的选择。
有时,导致推测出错的上下文缺失归根结底源于隐性知识:即人工智能无法知晓、而人类译者却能掌握的内容。有时,这是源文本本身的性质所致。源文本中可能包含会让人工智能模型感到困惑的语法错误。甚至可能包含作为风格选择而故意设置的语法错误。人工智能翻译器必须填补这些空白,推测作者的意图和含义。一个专门用于质量评估的模型可以检测到这种与原文的偏差并加以标记。
对于马丁、玛尔塔和团队而言,真正有趣的讨论始于如何对翻译中的这些“错误”进行分类,以及应赋予每种错误多大的严重程度。他们最初采用了久经考验的翻译质量多维度指标(MQM)框架,该框架侧重于语法、拼写、可读性等方面,以及译文是否准确对应源文本内容。
然而,在与语言专家合作的过程中,团队很快意识到,当处理由人工智能而非人类生成的翻译时,错误的类型会发生变化。机器翻译中不存在拼写错误。然而,在许多情况下,AI 缺乏隐性知识的问题会暴露无遗。
正因如此,TQE 的目标从来都不是取代人工审阅人。通过将翻译模型与评估模型相结合,我们确保人工智能能够检测到自身的局限性,并在需要时及时请审阅人介入,从而为他们节省宝贵的时间。他们仍然是该流程中不可或缺的一部分。我们的目标是让他们能够以更令人满意的方式与人工智能协作。
这需要取得一种平衡:既要标记每种潜在错误,又不能给审阅人增加更多工作量;同时,只对那些影响严重的错误发出警报。正因如此,关于“严重”、“重大”或“轻微”翻译错误的定义讨论,是 TQE 开发过程中最引人入胜的部分之一。
校准 TQE 的严格程度是我们与客户合作完善该模型的众多领域之一。我们正在整合 DeepL 的定制化功能(如术语表和风格规则),以赋予模型更丰富的语境知识。我们已将 TQE 作为 API 对外开放,同时正在添加错误修正建议,以及批量接受或拒绝错误的选项。
这些改进中的许多都源于使用我们 TQE 测试工具的客户所分享的见解。如果您希望参与人工智能翻译的这一新阶段的开发,请联系我们申请测试环境的访问权限。我们非常期待听到您对 TQE 的使用体验。
有兴趣访问我们的 TQE 测试环境吗?请发送邮件至 marta.danylenko@deepl.com。