Как создать глоссарий локализации с помощью ИИ

Как создать глоссарий локализации с помощью ИИ

Olivia Park
6 сентября 2026 г.· 10 мин чтения

Чтобы создать глоссарий локализации с помощью ИИ, сначала зафиксируйте продукт, версию, исходную и целевые локали. Извлекайте кандидаты только из утвержденного корпуса и храните для каждого понятия определение, разрешенные переводы, запрещенные или устаревшие варианты, контекст, источник, владельца и статус. ИИ находит кандидаты и несогласованность, но языковые и предметные специалисты утверждают каждый термин отдельно по локали.

Общий контролируемый процесс ИИ задает правила источников и проверки. Глоссарий поддерживает перевод с помощью ИИ, но не заменяет полную проверку качества и не делает непроверенный перевод авторитетным.

Ключевые выводы

  • Управляйте понятиями и значением, а не только парами частых слов.
  • Разделяйте исходные и целевые термины для каждой локали и региона.
  • Явно храните разрешенные, запрещенные, устаревшие и контекстные формы.
  • Требуйте от ИИ ссылки на утвержденные доказательства и отказ при их отсутствии.
  • До выпуска измеряйте покрытие и ложные срабатывания на контрольной выборке.
  • Версионируйте глоссарий и повторяйте проверку дрейфа после изменений.

Какие поля нужны, когда создаётся глоссарий локализации с помощью ИИ?

Глоссарий локализации — управляемый терминологический ресурс. Запись связывает одно понятие с одобренным выражением в определенном контексте. Она помогает переводчикам, редакторам, дизайнерам и автоматическим проверкам сохранять последовательность, не стирая обоснованные региональные различия.

ПолеНазначение
concept_idСтабильный ID понятия, не зависящий от слов
definitionУтверждённое значение и границы
domainПредметная область или часть продукта
source_locale, source_termУтвержденная исходная форма
target_locale, target_termУтвержденная форма конкретной локали
part_of_speechГрамматическое употребление и словоизменение
allowed_variantsРазрешенные сокращения и контексты
prohibited_variantsНедопустимые формы
deprecated_variantsСтарые формы для миграционного контроля
example, counterexampleПравильный и неправильный контекст
sourceПолитика, интерфейс, спецификация или решение владельца
owner, status, versionСогласование и жизненный цикл

Глоссарий интернационализации W3C показывает, почему понятия требуют определения и контекста.[1] Две колонки не передают омонимы, грамматику, региональные варианты и формы, допустимые только в конкретном интерфейсе.

Как создать терминологический ресурс на основе доказательств?

Шаг 1. Зафиксируйте периметр и иерархию источников

Запишите продукт, версию, типы контента, исходную и точные целевые локали, аудиторию, юрисдикции, утвержденный корпус, исключенные черновики, владельцев терминологии, роли проверки и планируемую дату выпуска. Кода es может быть недостаточно для разных правил es-MX и es-ES. Коды zh-Hans и zh-Hant обозначают письменность, но дополнительно может требоваться региональная политика. Родство языков не переносит утверждение между локалями.

Заранее решите, какой источник главнее при конфликте спецификации, утвержденного интерфейса, закона, бренда, предметного эксперта и памяти переводов. Запишите приоритет источников для каждого поля и лицо, решающее неоднозначность. Частота в корпусе доказывает употребление, но не авторитетность.

Шаг 2. Подготовьте утвержденный корпус

Соберите только финальные или явно одобренные материалы. Для каждого храните ID, версию, локаль, тип, владельца, статус и дату получения. Исключите черновики, старые снимки, машинные переводы, пользовательский и неразрешенный сторонний текст.

При нормализации форматов сохраняйте регистр, пунктуацию, заполнители, разметку и необходимый контекст. Удаляйте личные и конфиденциальные данные до обработки. Не смешивайте лингвистический ресурс со словарем данных: последний описывает поля, типы и системный смысл, а глоссарий — языковые понятия и допустимые выражения. При необходимости свяжите их, но не объединяйте полномочия.

Шаг 3. Задайте схему понятия до извлечения

Определите обязательные поля, статусы и проверки. Например: candidate, under_review, approved, deprecated, prohibited, rejected. Укажите, могут ли в одной локали существовать несколько одобренных терминов и как контекст их разделяет.

TBX в стандарте ISO 30042:2019 задает основу представления и обмена терминологическими данными.[2] Необязательно применять каждую функцию, но ориентация на понятия, языковые разделы, определения и административные метаданные полезны. Для обмена проверьте поддерживаемый диалект TBX и поля системы управления переводами, не предполагая совместимость.

Детерминированно проверяйте уникальность ID, допустимые коды локалей, наличие определения и владельца, статус, явный источник и формат даты или версии.

Шаг 4. Извлекайте кандидаты с цитатами

Передайте утверждённый корпус, ID источников, схему и исключения. Результат остаётся кандидатом:

Извлекайте повторяющиеся или предметные понятия только из переданных
утверждённых источников. Указывайте каждый ID и точный контекст. Разделяйте
метки UI, бренды, общие термины и правила локали. Не придумывайте определение
или целевой перевод. Неясности, омонимы и конфликты передавайте на проверку.
Верните записи-кандидаты в предоставленной схеме.

Проверьте существование каждой цитаты, ID источника и самого кандидата в корпусе. Одинаковое написание объединяется только после решения специалиста: «account» может означать учётную запись пользователя, финансовую запись или организацию-клиента, поэтому одной форме может соответствовать несколько понятий.

Модель может найти термины, несогласованные между утверждёнными источниками, но не должна выбирать верный вариант по частоте: самая частая форма может быть устаревшим текстом, который новая версия продукта прямо заменяет.

Шаг 5. Разделите соседние типы правил

До утверждения классифицируйте каждого кандидата:

  • Термин: предметное понятие с контролируемой формулировкой.
  • Строка UI: точный текст интерфейса с ограничениями места и взаимодействия.
  • Название бренда или продукта: подчиняется правилам названия и товарного знака.
  • Правило локали: даты, числа, адреса, кавычки, регистр или множественное число.
  • Стилевое предпочтение: тон, голос, пунктуация и общие редакционные решения.
  • Непереводимый элемент: код, заполнитель, название протокола или защищённый ID.

Unicode CLDR предоставляет данные локалей для дат, чисел, единиц, отображаемых названий и множественного числа.[3] Это не источник продуктовой терминологии: связывайте применимые правила локали ссылкой, а не копируйте данные CLDR в каждую запись глоссария.

Руководство по стилю контента управляет тоном, пунктуацией и общими редакционными решениями. Не копируйте широкие правила в каждую терминологическую запись.

Как утверждать, публиковать и отслеживать терминологию?

Шаг 6. Проверьте определение и исходный термин

Предметный владелец подтверждает существование, периметр и точность понятия. Определение должно отличать соседние понятия, а не объяснять слово через него же. Проверьте часть речи, регистр, сокращение, старые формы, примеры и ограничения интерфейса. Не скрывайте конфликт источников нормализацией: его разрешает владелец продукта или политики с записью решения.

Локали могут разделять ID понятия, но не обязаны использовать одинаковую грамматику. Существительное может стать фразой, изменить порядок, род, падеж или регистр.

Шаг 7. Утверждайте целевые термины по локалям

Для каждой локали языковой и предметный рецензент оценивают смысл, аудиторию, региональное употребление, грамматику, UI, доступность, право и существующий язык продукта. Сохраняйте разногласия и решение владельца.

Ресурсы Европейской комиссии показывают роль терминологических баз, стилевых руководств и человеческого управления в профессиональном переводе.[4] Публичная база помогает исследованию, но не отменяет требования продукта и юрисдикции. Нельзя механически переносить форму из fr-FR в fr-CA, между упрощённой и традиционной китайской письменностью или испанскими рынками. Нельзя массово утверждать перевод ИИ. Каждая локаль сохраняет независимые статус и доказательства.

Шаг 8. Измерьте покрытие и ложные срабатывания

Контрольная выборка должна включать обычный текст, UI, заголовки, поддержку, словоизменение, омонимы, запрещенные и старые формы, заполнители и допустимые исключения. Сохраните отдельную контрольную часть, которая не использовалась при настройке извлечения или правил проверки.

Измеряйте как минимум:

МетрикаПроверяемый вопрос
Покрытие утверждённых терминовОбязательные понятия выражены разрешёнными формами?
Полнота обнаружения запретовНайдены недопустимые варианты?
Ложные срабатыванияПравильный контекст ошибочно помечен?
Нерешённые случаиКак часто требуется человек?
Покрытие локалейДля каких локалей и типов контента нет доказательств?
Пересмотр человекомКак часто изменены предложения ИИ?

Детерминированный поиск пропускает формы и путает омонимы; ИИ понимает контекст, но может выдумать авторитет. Оба подхода требуют цитируемых доказательств; неопределённость передавайте людям. Контрольный список данных проверяет структуру, а лингвист — смысл.

Шаг 9. Выпустите версионируемый ресурс

Выпуск содержит версию, периметр, понятия, статусы локалей, снимок источников, изменения, владельцев, результаты, исключения, дату и формат экспорта. Утвержденные записи должны быть защищены от незаметной перезаписи новым извлечением.

До изменения термина найдите затронутые UI, документацию, макросы поддержки, память переводов, поисковые метаданные, снимки, обучение и метки архитектуры сайта. Решите, что меняется сейчас, в следующем выпуске или остается исключением. Для устаревшей формы при необходимости сохраните перенаправление или поисковый синоним, но не предпочтительную метку. Запишите причину запрета: закон, бренд, вводящая в заблуждение формулировка, устаревание, оскорбительность или стиль. Без причины проверяющий не сможет обоснованно разрешить исключение.

Шаг 10. Проверяйте дрейф терминологии

Сканируйте только утвержденные версионируемые снимки относительно замороженного глоссария. Каждое возможное отсутствующее понятие, устаревшая форма, неутверждённый вариант, конфликт определения или новый контекст должен ссылаться на ID контента, место, локаль, понятие и правило.

Классифицируйте находку как дефект контента, пробел глоссария, допустимое исключение, ложное срабатывание или несовпадение версий. Не заменяйте автоматически: краткая строка UI, цитата, юридическое имя, SEO-синоним или исторический материал могут быть исключением. Повторяйте процесс после смены названия продукта, выпуска функций, приобретения компаний, изменения закона, расширения рынка, исходной локали, системы переводов или повторяющихся разногласий проверяющих.

Какие ошибки чаще всего портят глоссарий?

  • Двуязычный список слов: управляйте понятиями, определениями, контекстом и метаданными жизненного цикла.
  • Частота принимается за авторитет: ссылайтесь на утверждённые источники и названных владельцев.
  • Термин одной локали копируется в другую: проверяйте каждую целевую локаль независимо.
  • Смешение терминов и стилевых правил: классифицируйте правило и назначьте верного владельца.
  • Массовое утверждение результата ИИ: все извлечённые и переведённые записи остаются кандидатами.
  • Срабатывание по каждому совпадению: тестируйте омонимы, словоизменение, цитаты и исключения.
  • Автоматическая замена: проверяйте влияние и сохраняйте допустимые различия контекста.

Итоги

  • Зафиксируйте продукт, версию, локали, корпус и порядок авторитетов.
  • Используйте записи понятий с определением, доказательством, владельцем и статусом.
  • ИИ извлекает и сравнивает кандидаты, но не утверждает их.
  • Разделяйте терминологию, UI, бренд, локальные и стилевые правила.
  • Проверяйте покрытие и ошибки на представительной выборке.
  • Версионируйте выпуск и обрабатывайте дрейф решениями людей.

Часто задаваемые вопросы (FAQ)

Может ли ИИ создать глоссарий из всех старых переводов?

Он может извлечь кандидаты, но старые переводы могут быть устаревшими, несогласованными или неутвержденными. Ограничьте корпус, сохраняйте ссылки на источники и привлекайте предметных и языковых владельцев для каждой локали.

Глоссарий — это список исходных и целевых слов?

Нет. Он ориентирован на понятия и включает определение, контекст, грамматику, варианты, запреты, источники, статус и владельца.

Каждое частое слово должно стать термином?

Нет. Приоритет имеют предметные, важные, неоднозначные, брендовые, регулируемые и часто расходящиеся понятия. Общая лексика остаётся под обычным редакционным и языковым контролем.

Можно ли утвердить один термин для всех регионов языка?

Только после отдельной проверки. Значение, грамматика, обычай, право и продуктовая практика могут различаться.

Чем запрещенный термин отличается от устаревшего?

Запрещенный нельзя применять в заданном контексте. Устаревший ранее был допустим и сохраняется для миграционного обнаружения. Запишите причину и версию.

Заменяет ли глоссарий стиль или контроль перевода?

Нет. Стиль, естественность, точность, форматирование, функции, доступность, заполнители и правила локали требуют других проверок и человеческого рассмотрения.

Как снизить ложные сигналы дрейфа?

Используйте правила локали, контекст, исключения и репрезентативную выборку. Требуйте точное вхождение, ID контента и понятия; измеряйте ложные срабатывания и пересмотр человеком.

Когда переутверждать запись?

При изменении понятия, продукта, источника, локали, правового требования, одобренного текста или контекста, с анализом влияния.

Отказ от ответственности: материал носит общий характер и не является сертифицированной переводческой, лингвистической, юридической консультацией либо советом по доступности, регулированию или товарным знакам. Для каждой области и локали нужны квалифицированные проверяющие.

Источники

  1. World Wide Web Consortium, Internationalization Glossary: https://www.w3.org/TR/i18n-glossary/
  2. International Organization for Standardization, ISO 30042:2019, Management of terminology resources — TermBase eXchange (TBX): https://www.iso.org/standard/62510.html
  3. Unicode Consortium, Common Locale Data Repository: https://cldr.unicode.org/
  4. European Commission, Guidelines for translating EU documents into English: https://knowledge-centre-translation-interpretation.ec.europa.eu/en/resources-translating-eu-documents/guidelines-translating-eu-documents-english

Sources checked 6 сентября 2026 г.

Рекомендуемые статьи

Начните бесплатный 3-дневный пробный период

Зарегистрируйтесь и попробуйте все премиум-функции бесплатно.

*Только для новых пользователей. Один пробный период на пользователя.

Как создать глоссарий локализации с помощью ИИ | AethoVPN