Вход на сайт

Просмотр новости

Найдите то, что Вас интересует

В МГУ разработали метод выявления ошибок в размеченных текстах

Дата публикации: 11-08-2026 13:12:15

Учёные факультета вычислительной математики и кибернетики МГУ разработали метод, позволяющий выявлять ошибки в размеченных текстах, используемых для обучения систем обработки языка.
Такие тексты представляют собой специальные корпуса, в которых для каждого предложения заранее указана его структура. Они используются при создании систем автоматического анализа языка, поэтому точность их разметки имеет ключевое значение.
В работе предложен подход, при котором на основе корпуса автоматически строится модель, способная воспроизводить его структуру. Если для одного и того же предложения система находит несколько вариантов разбора, это может указывать на возможные ошибки или неоднозначности в исходной разметке.
«Мы предложили способ, который позволяет автоматически находить потенциальные несоответствия в разметке и тем самым помогать экспертам быстрее их обнаруживать. Метод был протестирован на корпусе СинТагРус. В подмножестве из 8199 предложений система выявила 1148 случаев, где возможно несколько вариантов разбора. В большинстве из них — 1078 предложений — различия были связаны с разметкой запятых», — отметил доцент кафедры алгоритмических языков факультета ВМК МГУ Игорь Головин.
Разработанный инструмент не заменяет работу эксперта, но позволяет существенно сократить время анализа и сосредоточиться на наиболее проблемных местах в корпусе.
Подобные решения могут использоваться при подготовке языковых данных для систем искусственного интеллекта, где качество разметки напрямую влияет на точность моделей.
Результаты работы были представлены на научной конференции «Ломоносовские чтения».


Основное содержимое страницы с новостью.

Учёные факультета вычислительной математики и кибернетики МГУ разработали метод, позволяющий выявлять ошибки в размеченных текстах, используемых для обучения систем обработки языка.

Такие тексты представляют собой специальные корпуса, в которых для каждого предложения заранее указана его структура. Они используются при создании систем автоматического анализа языка, поэтому точность их разметки имеет ключевое значение.

В работе предложен подход, при котором на основе корпуса автоматически строится модель, способная воспроизводить его структуру. Если для одного и того же предложения система находит несколько вариантов разбора, это может указывать на возможные ошибки или неоднозначности в исходной разметке.

«Мы предложили способ, который позволяет автоматически находить потенциальные несоответствия в разметке и тем самым помогать экспертам быстрее их обнаруживать. Метод был протестирован на корпусе СинТагРус. В подмножестве из 8199 предложений система выявила 1148 случаев, где возможно несколько вариантов разбора. В большинстве из них — 1078 предложений — различия были связаны с разметкой запятых», — отметил доцент кафедры алгоритмических языков факультета ВМК МГУ Игорь Головин.

Разработанный инструмент не заменяет работу эксперта, но позволяет существенно сократить время анализа и сосредоточиться на наиболее проблемных местах в корпусе.

Подобные решения могут использоваться при подготовке языковых данных для систем искусственного интеллекта, где качество разметки напрямую влияет на точность моделей.

Результаты работы были представлены на научной конференции «Ломоносовские чтения».

Схожие новости

#Наименование новостиТональностьИнформативностьДата публикации
1В МГУ прошла одна из старейших конференций России по компьютерной лингвистике0526-06-2026
2В МГУ разработали метод анализа поведения пользователей для защиты данных011.5522-07-2026
3В РФ разработали методику обучения нейросетей сложным правилам русского языка0026-11-2025
4Тест Тьюринга могут заменить базы данных с текстами ИИ0018-04-2025
5😎 ИИ или как проверить текст без него и зачем ...05.3603-08-2026
6В МГУ предложили способ точной оценки качества автоматической сортировки писем0516-06-2026
7В России разработали алгоритм для повышения надежности бортовых систем0515-07-2026
8В России упростили оценку точности классического машинного обучения5714-07-2026
9В МГУ создали ИИ для поиска патологий на КТ без размеченных данных0716-07-2026

Классификация: Наука. Схожих патентов: 0. Схожих новостей: 9. Тональность: 0. Информативность: 11.42. Источник: cs.msu.ru.