Разработка и реализация методов генерации правил для автоматической проверки правописания

Компьютерная лингвистика и вычислительные онтологии Pub Date : 2020-12-17 DOI:10.17586/2541-9781-2020-4-83-97

Павел Ярославович Бахвалов

{"title":"Разработка и реализация методов генерации правил для автоматической проверки правописания","authors":"Павел Ярославович Бахвалов","doi":"10.17586/2541-9781-2020-4-83-97","DOIUrl":null,"url":null,"abstract":"Задача автоматической проверки правописания является актуальной: Количество написанного текста увеличивается с каждым годом, также, как и количество людей, начинающих изучать новые языки, и всем нам, как людям, свойственно делать ошибки. Существует два основных подхода к решению данной задачи: подход, основанный на машинном обучении, и подход, основанный на правилах. Первый имеет более высокое качество и не требует привлечение лингвистов, но с другой стороны второй позволяет объяснить пользователю причину ошибки и требует значительно меньше вычислительных ресурсов. Эти подходы можно комбинировать, объединяя их преимущества, и получать выигрыш в качестве. В настоящей работе представлен способ автоматического получения правил из аннотированного набора данных, которыми могут быть расширены системы автоматической проверки правописания после добавления описания. За основу был взят подход Transformation-Based Learning (TBL), который был доработан для использования на данных с большим количеством признаков. В результате были сгенерированы 1238 правил для 36 категорий ошибок. После этого, существующая система по проверке правописания LanguageTool была расширена полученными правилами и показала улучшение качества работы.","PeriodicalId":267743,"journal":{"name":"Компьютерная лингвистика и вычислительные онтологии","volume":"7 1","pages":"0"},"PeriodicalIF":0.0000,"publicationDate":"2020-12-17","publicationTypes":"Journal Article","fieldsOfStudy":null,"isOpenAccess":false,"openAccessPdf":"","citationCount":"0","resultStr":null,"platform":"Semanticscholar","paperid":null,"PeriodicalName":"Компьютерная лингвистика и вычислительные онтологии","FirstCategoryId":"1085","ListUrlMain":"https://doi.org/10.17586/2541-9781-2020-4-83-97","RegionNum":0,"RegionCategory":null,"ArticlePicture":[],"TitleCN":null,"AbstractTextCN":null,"PMCID":null,"EPubDate":"","PubModel":"","JCR":"","JCRName":"","Score":null,"Total":0}

引用次数: 0

Abstract

Задача автоматической проверки правописания является актуальной: Количество написанного текста увеличивается с каждым годом, также, как и количество людей, начинающих изучать новые языки, и всем нам, как людям, свойственно делать ошибки. Существует два основных подхода к решению данной задачи: подход, основанный на машинном обучении, и подход, основанный на правилах. Первый имеет более высокое качество и не требует привлечение лингвистов, но с другой стороны второй позволяет объяснить пользователю причину ошибки и требует значительно меньше вычислительных ресурсов. Эти подходы можно комбинировать, объединяя их преимущества, и получать выигрыш в качестве. В настоящей работе представлен способ автоматического получения правил из аннотированного набора данных, которыми могут быть расширены системы автоматической проверки правописания после добавления описания. За основу был взят подход Transformation-Based Learning (TBL), который был доработан для использования на данных с большим количеством признаков. В результате были сгенерированы 1238 правил для 36 категорий ошибок. После этого, существующая система по проверке правописания LanguageTool была расширена полученными правилами и показала улучшение качества работы.

查看原文

微信好友朋友圈 QQ好友复制链接

本刊更多论文

为自动拼写检查开发和实现规则生成方法

自动拼写检查的任务是相关的:文本的数量每年都在增加，学习新语言的人也在增加，我们所有人都有犯错误的习惯。解决这个问题有两种基本方法:基于机器学习的方法和基于规则的方法。第一个质量更高，不需要语言学家，但另一个允许用户解释错误的原因，需要更少的计算资源。这些方法可以组合在一起，结合它们的优势，并获得回报。本文介绍了一种从注释数据集中自动获取规则的方法，在添加描述后可以扩展拼写自动检查系统。它采用了一种转移-基础训练方法(TBL)，该方法被开发用于具有大量特征的数据。结果产生了36类错误的1238条规则。此后，现有的LanguageTool拼写检查系统被现有的规则所扩大，并显示了改进的性能。

本文章由计算机程序翻译，如有差异，请以英文原文为准。

求助全文

约1分钟内获得全文去求助

来源期刊

Компьютерная лингвистика и вычислительные онтологии

自引率

0.00%

发文量