Репост из: Локализация игр
В прошлый раз мы обсудили, что ИИ в локализации может и помогать в упрощении процессов, и непосредственно генерировать переводы. Но вот определять, что значит «хороший перевод», по-прежнему должен человек.
Как отмечают Language IO, LLMки способны выполнять практически все этапы переводческого процесса, от подготовки исходного текста и работы с терминологией до непосредственно перевода, адаптации стиля, оценки и улучшения результата (видим немало рабочих примеров, когда один ИИ оценивает качество работы другого ИИ, AI-as-a-judge), но полноценная оценка качества требует участия человека. Именно человек выносит вердикт, что такое хорошо, а что — статистически правдоподобная галлюцинация. ИИ может создать перевод, который выглядит беглым, последовательным и аккуратным, но при этом содержит незаметную или критически важную смысловую ошибку. Как подчеркивают в Language IO, самые опасные ошибки часто возникают именно в текстах, которые звучат правильно. По сути, это та же самая проблема, которую ещё годами ранее обсуждали при внедрении машинного перевода (MT) в игровую локализацию.
Человек задаёт критерии качества, понимает контекст и подтекст и самые различные технические, культурные и геополитические нюансы, принимает решения в ситуациях высокого риска и замечает ошибки, которые автоматические ИИ-проверки не способны увидеть.
🕹 А судьи кто?
Тем не менее, AI-as-a-judge уже вовсю используется в переводе. GPT умеет оценивать результат машинного перевода, специализированные модели могут находить и классифицировать языковые ошибки, Gemini оценивает результаты различных MT-движков, и т.д. А на главной конференции по машинному переводу, WMT, активно проводят соревнования для систем, задача которых — оценивать другие системы.
Один из самых распространенных примеров ИИ-судейства — AI/MT QE, quality estimation (предварительная оценка качества, а точнее, предсказание). Специальные модели оценивают качество посегментно без участия человека, а также пытаются определить, можно ли этот перевод публиковать без постредактуры. Человек же задаёт критерии, участвует в обучении и калибровке моделей и т.п. AIQE модули встроены в различные TMS-решения, в которых непосредственно и происходит современная локализация.
Но если ИИ и справляется (хотя далеко не всегда) с тем, чтобы оценивать качество по заданным параметрам, то вот решить, правильны ли сами эти параметры, уже сложнее. А ещё ИИ бывает предвзят к собственному output или к output похожих моделей. Поэтому пока что ИИшная оценка ИИ выглядит перспективно как первый этап контроля качества, но не как окончательная инстанция. Тем более в играх.
Со временем языковой специалист (лингвист, переводчик, менеджер по качеству и т.д.) вероятно перестать проверять всё, но ему всё равно нужно будет решить, что именно считать ошибкой, насколько она критична и когда ИИ-оценщикам можно доверять. Недавние исследования демонстрируют, что добавление более длинного контекста улучшает согласованность автоматических QE-моделей с человеческими оценками: т.е., сами ИИ-судьи пока продолжают учиться тому, что человек считает качественным переводом.
🕹 Что делать?
Будущее перевода видится высокоавтоматизированным, но в его основе по-прежнему должно оставаться человеческое суждение. Как обговорили в прошлый раз, роль переводчика и локализатора не исчезает — она меняется.
Кроме того, на сегодня остаются рабочими и привычные переводческие сценарии. Как недавно писали на дружественном канале, по словам крупнейшей переводческой компании RWS, «…переопределяется дистрибуция перевода — но человек остаётся незаменим в медицине, праве, маркетинге и креативе». Human-in-the-loop — это не защитная позиция переводческих компаний «на всякий случай», а прямой запрос конечного потребителя.»
А вот ждет ли нас полный Human-in-the-loop (как с юмором говорят коллеги, «человек в петле») или всё же Human-in-control, обсудим в следующий раз!
Локализация игр x Gamelocalization 🐼
Как отмечают Language IO, LLMки способны выполнять практически все этапы переводческого процесса, от подготовки исходного текста и работы с терминологией до непосредственно перевода, адаптации стиля, оценки и улучшения результата (видим немало рабочих примеров, когда один ИИ оценивает качество работы другого ИИ, AI-as-a-judge), но полноценная оценка качества требует участия человека. Именно человек выносит вердикт, что такое хорошо, а что — статистически правдоподобная галлюцинация. ИИ может создать перевод, который выглядит беглым, последовательным и аккуратным, но при этом содержит незаметную или критически важную смысловую ошибку. Как подчеркивают в Language IO, самые опасные ошибки часто возникают именно в текстах, которые звучат правильно. По сути, это та же самая проблема, которую ещё годами ранее обсуждали при внедрении машинного перевода (MT) в игровую локализацию.
Человек задаёт критерии качества, понимает контекст и подтекст и самые различные технические, культурные и геополитические нюансы, принимает решения в ситуациях высокого риска и замечает ошибки, которые автоматические ИИ-проверки не способны увидеть.
🕹 А судьи кто?
Тем не менее, AI-as-a-judge уже вовсю используется в переводе. GPT умеет оценивать результат машинного перевода, специализированные модели могут находить и классифицировать языковые ошибки, Gemini оценивает результаты различных MT-движков, и т.д. А на главной конференции по машинному переводу, WMT, активно проводят соревнования для систем, задача которых — оценивать другие системы.
Один из самых распространенных примеров ИИ-судейства — AI/MT QE, quality estimation (предварительная оценка качества, а точнее, предсказание). Специальные модели оценивают качество посегментно без участия человека, а также пытаются определить, можно ли этот перевод публиковать без постредактуры. Человек же задаёт критерии, участвует в обучении и калибровке моделей и т.п. AIQE модули встроены в различные TMS-решения, в которых непосредственно и происходит современная локализация.
Но если ИИ и справляется (хотя далеко не всегда) с тем, чтобы оценивать качество по заданным параметрам, то вот решить, правильны ли сами эти параметры, уже сложнее. А ещё ИИ бывает предвзят к собственному output или к output похожих моделей. Поэтому пока что ИИшная оценка ИИ выглядит перспективно как первый этап контроля качества, но не как окончательная инстанция. Тем более в играх.
Со временем языковой специалист (лингвист, переводчик, менеджер по качеству и т.д.) вероятно перестать проверять всё, но ему всё равно нужно будет решить, что именно считать ошибкой, насколько она критична и когда ИИ-оценщикам можно доверять. Недавние исследования демонстрируют, что добавление более длинного контекста улучшает согласованность автоматических QE-моделей с человеческими оценками: т.е., сами ИИ-судьи пока продолжают учиться тому, что человек считает качественным переводом.
🕹 Что делать?
Будущее перевода видится высокоавтоматизированным, но в его основе по-прежнему должно оставаться человеческое суждение. Как обговорили в прошлый раз, роль переводчика и локализатора не исчезает — она меняется.
Кроме того, на сегодня остаются рабочими и привычные переводческие сценарии. Как недавно писали на дружественном канале, по словам крупнейшей переводческой компании RWS, «…переопределяется дистрибуция перевода — но человек остаётся незаменим в медицине, праве, маркетинге и креативе». Human-in-the-loop — это не защитная позиция переводческих компаний «на всякий случай», а прямой запрос конечного потребителя.»
А вот ждет ли нас полный Human-in-the-loop (как с юмором говорят коллеги, «человек в петле») или всё же Human-in-control, обсудим в следующий раз!
Локализация игр x Gamelocalization 🐼