DeepL AI Labs
Проблема с переводами, выполненными с помощью ИИ, заключается в том, что они выглядят безупречно, даже если это не так. Поскольку ошибки не бросаются в глаза с первого взгляда, вам приходится полагаться на утверждение модели ИИ о том, что всё верно. Единственная альтернатива — поручить специалистам по языку просматривать перевод строка за строкой, выявляя ошибки, неполные переводы и тонкие изменения смысла, которые неспециалисту, скорее всего, ускользнут из виду.
Эта необходимость в бесконечной проверке является одной из наиболее распространённых жалоб, которые команды специалистов по локализации высказывают в отношении переводов, выполненных с помощью ИИ. Это поднимает фундаментальный вопрос для всех, кто занимается исследованиями в области языкового ИИ. Как машинный перевод может завоевать доверие организаций, полагающихся на него? Как избежать необходимости просить редакторов-людей повторно проверять уже выполненную работу, лишь для того, чтобы убедиться в её правильности?
Оказывается, ИИ способен решить эту проблему, но не с помощью той же модели ИИ, которая изначально создала перевод. Тестирование качества показало, что при проверке переводов с помощью больших языковых моделей (LLM) они отдают предпочтение результатам собственной модели и упускают из виду её потенциальные слабые места. Когда речь идет об ИИ, невозможно завоевать доверие, поручая модели проверять результаты своей собственной работы. Однако этого можно добиться, создав и обучив отдельную модель, полностью ориентированную на выявление любых потенциальных ошибок или неверных интерпретаций.
Именно этим и занимались старший менеджер по продукту DeepL Марта Даниленко, старший научный сотрудник Мартин Бергер и остальные члены команды, стоящей за нашим инструментом оценки качества перевода (TQE). Они разработали независимую модель ИИ TQE с одной конкретной целью: проводить стресс-тестирование переводов и классифицировать любые ошибки или потенциальные ошибки, о которых должны знать клиенты.
Экспертный редактор TQE на базе ИИ просматривает переводы сегмент за сегментом, отображая исходный и переведённый текст рядом друг с другом. В отдельной колонке выделяются все потенциальные проблемы в переводе с указанием категории серьезности: «Критическая», «Серьёзная» или «Незначительная». Редакторы-люди могут перейти к каждой потенциальной проблеме, проверить сегмент, изменить перевод напрямую, пометить проблему как устраненную или, в качестве альтернативы, просто игнорировать отметку.
В связи с этим возникает очевидный вопрос, на который Марта и Мартин часто отвечают: Если TQE знает о наличии ошибок, почему система не может просто исправить их самостоятельно? Зачем вообще привлекать редакторов-людей? Причина кроется в самой природе этих ошибок. А это — прямое следствие особенностей ИИ.
Модели ИИ по сути своей являются вероятностными. Они делают высокоагрегированные статистические предположения с невероятной точностью, но это всё же лишь предположения — и иногда они оказываются неверными. Когда отсутствует важный контекст, вероятность ошибки возрастает. Другая модель может обнаружить расхождение и потенциальную неоднозначность, но не может исправить это, не сделав очередного предположения. Гораздо лучше привлечь к работе человека.
Иногда отсутствие контекста, приводящее к ошибочным предположениям, сводится к неявным знаниям: к тому, чего ИИ не может знать, а переводчик-человек — может. Иногда это связано с особенностями самого исходного текста. В нём могут содержаться грамматические ошибки, сбивающие с толку модель ИИ. В нём могут даже присутствовать намеренные грамматические ошибки, являющиеся стилем. ИИ-переводчик вынужден восполнять пробелы, угадывая замысел и смысл. Модель, специально разработанная для оценки качества, способна обнаружить такое отклонение от оригинала и отметить его.
Для Мартина, Марты и всей команды по-настоящему интересные дискуссии начались с вопроса о том, как классифицировать эти «ошибки» в переводе и какую степень серьезности присваивать каждой из них. Сначала они использовали давно устоявшуюся систему многомерных показателей качества (MQM) для оценки качества перевода, которая фокусируется на таких аспектах, как грамматика, орфография, читабельность, а также на том, насколько точно перевод соответствует исходному тексту.
Однако, работая с лингвистами, команда быстро поняла, что типы ошибок меняются, когда речь идет о переводе, выполненном ИИ, а не человеком. В машинном переводе нет опечаток. Однако часто возникают ситуации, когда становится очевидным отсутствие неявных знаний.
Именно поэтому целью TQE никогда не было заменить редакторов-людей. Объединяя модель перевода с моделью оценки, мы гарантируем, что ИИ способен выявлять собственные ограничения и привлекать редакторов там, где это необходимо, что позволяет им сэкономить драгоценное время. Они по-прежнему остаются неотъемлемой частью процесса. Цель состоит в том, чтобы дать им возможность работать с ИИ более эффективно.
Для этого необходим баланс: с одной стороны, необходимо выявлять все типы потенциальных ошибок, не создавая при этом лишней нагрузки на редакторов, а с другой — выдавать предупреждения только в тех случаях, когда ошибки имеют серьезные последствия. Именно поэтому дискуссии о том, что представляет собой критическая, серьёзная или незначительная ошибка в переводе, стали одними из самых интересных на этапе разработки TQE.
Определение уровня строгости TQE — одна из многих областей, в которых мы совместно с клиентами работаем над доработкой модели. Мы интегрируем функции настройки DeepL, такие как глоссарии и правила стиля, чтобы обогатить модель контекстуальными знаниями. Мы сделали TQE доступным в виде API, а также добавляем рекомендации по исправлению ошибок и опции для массового принятия и отклонения ошибок.
Многие из этих усовершенствований основаны на отзывах клиентов, использующих наш инструмент тестирования TQE. Если вы хотите принять участие в разработке этого следующего этапа развития ИИ в области перевода, пожалуйста, свяжитесь с нами, чтобы запросить доступ к тестовой среде. Мы будем рады узнать, как TQE работает у вас.
Хотите получить доступ к нашей тестовой среде TQE? Напишите по адресу marta.danylenko@deepl.com.