bookmark_borderОмонимия объекта и действия

Только закончили тестировать новые возможности Real AI SA при разборе классики мировой литературы, как уже выпустили серьезное обновление в части разбора омонимии.

Корректное понимание омонимов – слов, с одинаковым звучанием и написанием, но имеющим разный смысл – серьезная задача при анализе естественного языка.

Условно, можно разделить два случая омонимии.

Первый — омонимия двух объектов, как, например в предложении «Он поднял кисть». Здесь смысловая модель построится корректно, даже если выберется любое из значений слова «кисть», известных системе. «Кисть» (в любом из значений) станет объектом, «Он» – актором, а «поднял» – связующим действием.

Второй — намного более сложный случай, когда написанный омоним может значить и объект и действие. В этом случае правильное построение модели невозможно, ведь нет понимания – считать ли разобранный набор букв за действие, с определенным набором допустимых параметров, или за объект.

В ходе развития семантического анализатора мы провели работу и определили, что в русском языке порядка 400 пар с начальной формой существительного и начальной формой глагола, словоформы которых совпадают по написанию и звучанию. Например – «стекло», в значениях «стекать» или материала, «ушей», в значении «ушивать» или множественного числа от слова «ухо» в родительном падеже.

Собственно, над вторым случаем омонимии и работали последнее время, получив хороший результат при разборе неоднозначных конструкций, которые вызывают затруднения даже у современных LLM.

Как пример — в заглавной картинке к посту приведен морфологический разбор фразы «Ушей это платье», проведенный моделью Claude Opus 5 medium, которая распознала вместо действия «ушивать» объект «уши».

Вот пара примеров разбора омонимии объектов и действий Real AI SA:

Ссылки приведены на старое демо, но разумеется эти и другие фразы можно разбирать и на t2graph, где еще можно посмотреть JSON полученных моделей.

bookmark_borderНовая ступень развития Real AI SA. Пробуем разбирать мировую классику.

Завершили еще один технологический этап развития семантического анализатора Real AI SA.

В текущей версии присутствуют более серьезные методы обработки прилагательных в разных ролях, внедрены новые механизмы разрешения омонимии, увеличена общая производительность и отказоустойчивость.

Количество же описанных понятий в базе знаний системы превысило уже 4000.

Как и всегда – после серьезной доработки – приступаем к серьезному тестированию.

В предыдущих постах писали про разбор фраз из произведений Пушкина и Чехова. В этот же раз попробовали подступиться к текстам из произведений Алана Эдгара По.

Вот несколько цитат из произведения «Длинный ларь» с любопытными вариантами их разбора в он-лайн демо нашего семантического анализатора:

bookmark_borderОмонимия существительное/прилагательное

В русском языке распространена ситуация, когда слово, представляющееся по форме прилагательным или причастием, используется на месте подлежащего, как существительное. Например – «больной выглядел лучше» или «потерпевший сообщил детали происшествия».

При решении задачи построения смысловой модели подобных предложений возникает два варианта решения.

Первый – описывать для всех таких слов в базе знаний анализатора два понятия с различной семантикой – одно для прилагательного и второе для существительного.

Второй – описать только прилагательное, а в случае использования его в роли существительного создавать подразумеваемый объект (Gap Object в модели), обладающий свойством, представляемым прилагательным.

Второй вариант показался более рациональным и в Real AI SA реализовали именно его.

Кроме того, он позволил не создавать запись в базе знаний для каждого прилагательного, так как понятие создается и соответствующим образом обрабатывается просто на основе морфологических данных.

Разумеется, даже в этом случае сохраняется возможность вручную описать и отдельные понятия для прилагательного и существительного.

С примерами обработки таких конструкций можно ознакомиться в нашем бесплатном демо, например, на следующих фразах:
«Быстрый посыльный доставил важный пакет»
«Пожарный вынес из горящего дома»

bookmark_borderИндустриальный код, этап 2

Посетили вводное мероприятия в рамках второго этапа «Индустриального кода» – программы, проводимой ГК «Ростех», нацеленной на поиск технологических проектов для пилота и масштабирования.

Организаторы рассказали, что всего было подано 130 заявок и только 31 проект прошел экспертный отбор.

На конкурс мы подавали Real AI SA с практическим сценарием автоматизации ведения электронного архива документов. Приятно, что члены комиссии высоко оценили и технологическую составляющую проекта и его потенциальную практическую пользу.

Дальнейшие шаги – за месяц, вместе с назначенными экспертами, подготовить качественную презентацию, с которой необходимо будет выступить в живую перед ЛПР из контура госкорпорации.

В целом программа похожа на Индастрикс, который проводит ПАО «Газпром Нефть», разве что еще на начальном этапе становления и организаторы сами понимают некоторые моменты, которые в дальнейшем можно улучшить. Например, в рамках Индастрикса происходит поиск потенциально заинтересованных лиц в контуре «Газпром Нефти» перед итоговым выступлением. Здесь же, в «Индустриальном коде», предложили поискать запросы в интернете и надеяться, что презентация попадет в боль одного из присутствующих ЛПР. Чей состав также неизвестен. 🙂

Считаем, что любой способ подсветки проекта нам на пользу, учитывая его наукоемкость, а живое выступление и последующее общение может обернуться если и не пилотом, то полезными контактами или экспертными интервью.