Электронный фонд правовой
и нормативно-технической документации
ГОСТ Р ИСО 24614-1-2013 Менеджмент языковых ресурсов. Пословная сегментация письменных текстов. Часть 1. Основные концепции и общие принципы
ГОСТ Р ИСО 24614-1-2013
НАЦИОНАЛЬНЫЙ СТАНДАРТ РОССИЙСКОЙ ФЕДЕРАЦИИ
МЕНЕДЖМЕНТ ЯЗЫКОВЫХ РЕСУРСОВ
Пословная сегментация письменных текстов
Часть 1
Основные концепции и общие принципы
Language resource management. Word segmentation of written texts. Part 1. Basic concepts and general principles
ОКС 01.020, 01.040.01
Дата введения 2015-01-01
Предисловие
1 ПОДГОТОВЛЕН ЗАО "Проспект" на основе собственного перевода на русский язык англоязычной версии стандарта, указанного в пункте 4
2 ВНЕСЕН Техническим комитетом по стандартизации ТК 55 "Терминология, элементы данных и документация в бизнес-процессах и электронной торговле"
3 УТВЕРЖДЕН И ВВЕДЕН В ДЕЙСТВИЕ Приказом Федерального агентства по техническому регулированию и метрологии от 08 ноября 2013 г. N 1386-ст
4 Настоящий стандарт идентичен международному стандарту ИСО 24614-1:2010* "Менеджмент языковых ресурсов. Пословная сегментация письменных текстов. Часть 1. Основные концепции и общие принципы" (ISO 24614-1:2010 "Language resource management - Word segmentation of written texts - Part 1: Basic concepts and general principles", IDT)
________________
* Доступ к международным и зарубежным документам, упомянутым в тексте, можно получить, обратившись в Службу поддержки пользователей. - Примечание изготовителя базы данных.
5 ВВЕДЕН ВПЕРВЫЕ
6 ПЕРЕИЗДАНИЕ. Январь 2019 г.
Правила применения настоящего стандарта установлены в статье 26 Федерального закона от 29 июня 2015 г. N 162-ФЗ "О стандартизации в Российской Федерации". Информация об изменениях к настоящему стандарту публикуется в ежегодном (по состоянию на 1 января текущего года) информационном указателе "Национальные стандарты", а официальный текст изменений и поправок - в ежемесячном информационном указателе "Национальные стандарты". В случае пересмотра (замены) или отмены настоящего стандарта соответствующее уведомление будет опубликовано в ближайшем выпуске ежемесячного информационного указателя "Национальные стандарты". Соответствующая информация, уведомление и тексты размещаются также в информационной системе общего пользования - на официальном сайте Федерального агентства по техническому регулированию и метрологии в сети Интернет (www.gost.ru)
1 Область применения
В настоящем стандарте представляются основные понятия и общие принципы пословной сегментации и даются не зависящие от языка руководящие указания по сегментации письменных текстов надежным и воспроизводимым способом на единицы пословной сегментации (WSU).
ПРИМЕЧАНИЕ: В связанной с языком научно-исследовательской и практической работе слово является фундаментальным и необходимым понятием. Поэтому для целей сегментации текста на слова важно иметь универсальное определение того, что включает слово. Нельзя просто использовать для разграничения слов правила, основанные на идентификации пробелов и знаков пунктуации. Такие правила не учитывают случаи сложных слов, которые пишутся через дефис, сокращений, идиом или словоподобных выражений, содержащих символы или цифры. Пословная сегментация еще более проблематична в языках, которые не содержат пробелов для разделения слов, например, для китайского и японского языков, а также в агглютинативных языках, где некоторые классы функциональных слов реализуются как аффиксы, например, в корейском языке.
Некоторые применения и сферы, которые требуют сегментировать тексты на слова и к которым, следовательно, применима данная часть ИСО 24614, представлены ниже
Перевод
Подсчет слов является главным методом оценки стоимости перевода. Пословная сегментация - это стандартная функция в системах переводческой памяти и в инструментальных средствах автоматизированного перевода (CAT). Пословная сегментация выполняется средствами извлечения терминов, которые иногда предоставляются в системах управления терминологией и в средствах CAT.
Управление контентом
Большинство систем и баз данных для управления информационным содержанием (контентом) предусматривают поиск по отдельным словам. Содержание, по которому производится поиск, должно быть сегментировано, чтобы была возможность сравнения со словом поиска. Кроме того, поисковые функции требуют знания границ слов.
Технологии распознавания речи
Системы речевого воспроизведения текста синтезируют речь на базе слов и поэтому требуют пословной сегментации для обеспечения возможности словарного поиска, расстановки ударений, установления просодического образца и др.
Прикладная лингвистика
Различные системы обработки текстов на естественных языках (NLP) должны сегментировать текст на слова для того, чтобы выполнить свои функции. Системы NLP включают:
Доступ к полной версии документа ограничен
Документ «ГОСТ Р ИСО 24614 1 2013 Менеджмент языковых ресурсов. Пословная сегментация письменных текстов. Часть 1. Основные концепции и общие принципы» предназначен для установления общих принципов и методов сегментации текстов на уровне слов. Он применяется в области обработки естественного языка, а также в разработке программного обеспечения для автоматизированного анализа текстов, что актуально для лингвистов, программистов и специалистов по языковым технологиям.
Основные аспекты, регламентируемые данным стандартом, включают методы сегментации, параметры, которые необходимо учитывать при обработке текстов, и требования к программным средствам, осуществляющим данную задачу. Документ описывает различные подходы к сегментации, включая правила, основанные на лексических и грамматических свойствах языков, а также на контексте, в котором используются слова.
Важные технические детали включают определение единиц измерения и критериев для оценки качества сегментации, а также условия, при которых проводятся испытания программных решений. Стандарт также затрагивает вопросы классификации текстов по типам и жанрам, что позволяет более точно настраивать алгоритмы сегментации для различных задач.
Целевая аудитория стандарта включает производителей программного обеспечения, исследовательские лаборатории, а также контролирующие органы, занимающиеся качеством языковых ресурсов. Стандарт служит основой для разработки и улучшения технологий обработки текстов, что в свою очередь способствует повышению качества и эффективности работы с языковыми данными.
Практическое значение стандарта заключается в его влиянии на качество обработки текстовой информации, что напрямую сказывается на безопасности и надежности систем, использующих языковые технологии. Стандарт способствует улучшению совместимости различных программных решений и повышению их эффективности, что важно для пользователей и разработчиков.
В документе также могут быть указаны изменения и дополнения, касающиеся уточнения методов сегментации и обновления требований к программным средствам. Эти изменения направлены на адаптацию стандартов к современным технологиям и потребностям пользователей, что делает его актуальным в условиях быстро развивающейся области языковых ресурсов.
Описание документа носит справочный характер, достоверность этого материала не гарантируется.
Чтобы получить полный доступ к этому и другим документам, приобретайте доступ к Информационной сети «Техэксперт» - лидеру в области комплексного обеспечения предприятий нормативно-технической документацией.
доступны в системах «Техэксперт» и «Кодекс»