bookmark_borderОт прототипа до тиража – открытый диалог в МИРБИС

Посетили в четверг мероприятие «Вечерний R&Dиалог: от прототипа до тиража: кто платит за дорогостоящую стадию?», проводимое в Московской международной высшей школе бизнеса «МИРБИС».

Было интересно послушать мнение об инновациях со стороны крупных компаний, в том числе и с государственным участием.

Из положительного отметили, что сейчас активно идет реализация стратегии по увеличению финансирования наукоемких проектов. Ее ключевая задача – довести показатель финансирования до 2% от ВВП к 2030 году.

Направление очень правильное, но пока возникают затруднения. Например – не определено, за чей счет будут осуществляться приток средств. Промышленность ищет уже готовые решения и не располагает ресурсами на тестирование гипотез, банки – располагают средствами, но не хотят рисковать, выбирая для инвестирования уже зрелые проекты.

Кроме того, любопытным показалось негодование представителя инновационного блока одной из госкорпораций, направленное на то, что стартапы хотят денег за пилоты, а им, инновационному подразделению государственной корпорации, стартапы не хотят оплачивать время и затраченные ресурсы.

Вместе с тем, как и на других похожих мероприятиях, часто ставился знак равенства между «инновацией» и «копированием уже существующего, но ставшего недоступным, решения».

Подняли вопрос, а как достучаться до крупных игроков, когда все же команда пытается сделать что-то новое, а не копировать.

Организаторы и спикеры не смогли дать ответ, однако предложили в рамках «МИРБИС» попробовать организовать диалог по вопросу – как достучаться до бизнеса стартапам, что определенно можно назвать позитивной динамикой.

bookmark_borderДве функции конструкции «X есть/был/будет Y»

В русском языке выражения «X есть/был/будет Y» или «X – это Y» могут выполнять две разные функции.

Первая функция – указывает на знание или констатацию факта, например – «яблоко есть фрукт», «Вася есть человек». Здесь мы определяем первое понятие, задавая его через более общее понятие, имеющее существенные свойства. Эта роль подобна наследованию (или созданию экземпляра класса) в объектно-ориентированном подходе.

Вторая функция имеет указательную природу, наводя фокус и выстраивая связь от одного понятия к другому. Например – «Вася – это хоккеист» или «ветки были материалом для шалаша». Здесь речь идёт не об абсолютном знании об объектах «Вася» или «ветки», а скорее о присвоении некоей роли.

При этом роль определяет не существенные свойства объекта, а какую-то ограниченную временем или выполняемым действием характеристику. То есть, Вася проявляет свойства хоккеиста только во время игры в хоккей, а в других действиях может являться сотрудником компании.

Мы видим, что для подобных понятий основой является действие, в котором участвует объект – тот, кто играет в хоккей – хоккеист, то из чего сделано — материал, почему что-то сделано — причина, чем что-то сделано – инструмент и так далее.

Таким образом, если связать в базе знаний различные свойства действия с той или иной характеристикой (например, актор действия «продавать» и «продавец»), то система получит возможность понимать взаимосвязь выражений «Мария продает клубнику» и «Мария продавщица клубники».

Планируем в ближайших версиях реализовать данный подход и посмотреть, какие это откроет новые возможности при анализе текста.

bookmark_borderПрограмма «Индустриальный код» от «Ростеха»

Не успел завершиться первый блок акселератора МИФИ, как мы подали заявку для участия в новой программе – «Индустриальный код», которую проводит Госкорпорация «Ростех».

Программа нацелена на поиск проектов для проведения пилотов и масштабирования в контуре государственной корпорации и ее партнеров. Это не классический акселератор, скорее – открытое окно инноваций, куда можно представить проект для быстрого контакта с потенциальным заказчиком.

В программе предусмотрены конкретные технологические запросы, по которым отбираются проекты – например «Проведение НИР и НИОКР по разработке (узлов, деталей) перспективных ДВС и гибридных силовых установок ВС и БПЛА с возможностью оперативного изготовления опытных образцов» или «Ключевые узлы и компоненты для вертикально-фрезерных обрабатывающих центров (напр. автоматические сменщики инструмента)».

На программу мы заявили Real AI CKG, который поможет автоматизировать бизнес-процессы, связанные с необходимостью анализа и извлечения данных из документов, а технологическое направление, которому соответствуем, выбрали «Создание доверенного ПО» в треке «ИИ и Машинное обучение».

Заявка на участие – одна из самых подробных, которую приходилось заполнять – 9 вкладок для описания проекта и команды со всевозможных ракурсов. Это, пожалуй, даже более обстоятельно, чем заявка на получение гранта от Фонда Содействия Инновациями.

Возможно, коллегам требуется в рамках проекта нечто более коробочное, чем наш разрабатываемый семантический анализатор, но надеемся на новые контакты и возможный выход на пилот.

bookmark_borderДемо-день акселератора МИФИ

В среду, 3 мая, выступили на Демо-дне акселератора технологических проектов, проводимом в НИЯУ МИФИ.

Организаторы постарались серьезно и пригласили индустриальных партнеров из различных сфер, не ограничиваясь контуром ГК «Росатом», для которой МИФИ является главным опорным ВУЗом. Например, на мероприятии были и представители банкинга, и ритейла, и крупных разработчиков IT-решений.

Сами проекты также были весьма разнообразны – от приложений для поиска компании с целью посетить культурное мероприятие и 3D-принтеров по подписке с запросом инвестиций в 20 миллионов, до крайне наукоемких аппаратных комплексов, способных сохранить миллиарды рублей при успешной реализации на атомных станциях.

Мы же предлагали вниманию слушателей проект на базе нашего семантического анализатора – Real AI CKG – инструмент для извлечения информации из неструктурированного текста за счет построения связанных смысловых моделей документов.

Учитывая разнопрофильность экспертов, в презентации отступили от канона и не сосредотачивались на одной конкретной боли, закрываемой проектом, а подсветили целый спектр процессов, связанных с анализом текста, которые можно автоматизировать.

Доклад вызвал обсуждение со стороны технической части, а именно – что происходит при обработке, возможны ли галлюцинации и какой фундамент у применяемого нами подхода.

Были вопросы и практического характера с озвучиванием конкретных интересных задач. В ходе общения увидели возможность решать их эффективнее, чем существующие продукты на базе LLM.

Остаемся с коллегами на связи и надеемся на продуктивное дальнейшее взаимодействие.

bookmark_borderВнимание, как неоплачиваемый труд

На сегодняшний день труд и трудовые ресурсы рассматриваются как ключевое понятие в экономике.

Еще Адам Смит в книге «Исследования о богатстве народов» делал вывод, что основой пропорции обмена является количество стоящего за производством товаров труда.

И труд, превращаясь в продукты или услуги, служит источником денег для всех участвующих в этом процессе. Ну а заработная плата в данном процессе — это материальное вознаграждение за выполненный труд.

Вместе с тем, в последнее время мы наблюдаем бурный рост способов получения денег, при котором от большого числа людей забирается труд, но компенсации за это не выплачивается. Речь идет о различных направлениях маркетинга – реклама, блогеры и т.д., которые присваивают результаты внимания зрителей, читателей или подписчиков.

При этом внимание вполне оправданно можно считать трудом, что согласуется с нашим пониманием деятельности человека. Ведь сохранение фокуса внимания – это одна из стадий выполнения любых хоть сколько-нибудь сложных действий, требующая затрат энергии.

Новые технологии позволяют получать внимание со все большего числа людей (да и численность населения Земли увеличивается), что приводит к огромным заработкам тех кто сумел капитализировать этот, пока еще бесплатный, труд.

В текущей ситуации сами зрители, читатели и подписчики не получают никакой компенсации за отданное внимание. И, как ни странно, считают это нормальным, вероятно, оценивая свои затраты как незначительные.

Кажется, что настало время переосмыслить основы экономики и включить туда новый вид трудового ресурса — внимание, и определить порядок получения за него вознаграждения.

Кстати в отдельных сферах это уже признается — например существует практика взимания денег за встречу с важным или влиятельными людьми.

bookmark_borderАкселератор BuildUP

Подали вчера заявку на участие в акселераторе технологических стартапов от лидеров в строительстве и девелопменте BuildUP.

Это пожалуй одно из самых серьезных мероприятий в области строительства, где есть возможность напрямую пообщаться с такими крупными игроками, как ГК «Галс-Девелопмент» или ГК ФСК.

В прошлом году мы подавали заявку со сценарием применения Real AI SA для анализа документов – извлечения сутевой части из договоров или поручений из распорядительных документов, однако первичный отбор не прошли.

В этот раз подготовились серьезнее и совместно с привлеченными трекерами подали на участие проект для автоматизации ведения архива внутренних документов организации.

Real AI SA для такого сценария может эффективно выявлять статусы обрабатываемых документов и без участия специалиста вносить изменения в их карточки, а также строить связи между, например, приказами и соответствующими регламентами. Как результат – снижение ошибок, вызванных человеческим фактором, и уменьшение трудозатрат на ведение внутренних архивов документов.

Надеемся, что в этот раз проект вызовет интересу жюри и Real AI SA попадет в список отобранных по результатам экспертной оценки.

bookmark_borderОбработка неизвестных понятий

В предыдущем посте мы писали, что одно из ключевых технологических преимуществ нашего свойство-ориентированного подхода при анализе текста – это возможность оперировать с понятиями на базовом уровне, предшествующем смысловому.

Покажем это преимущество более наглядно в сравнении с классическим, объектно-ориентированным подходом (ООП).

При разработке онтологии для семантического анализатора на ООП нам сразу предлагается:

  1. определить цели системы;
  2. выделить основные классы понятий и их свойства;
  3. продумать возможные отношения между ними;
  4. описать онтологию на одном из языков (например, OWL)

Кроме того, при проектировании рекомендуется подумать над масштабированием и заранее определить, какие из этих пунктов можно дополнить и чем. В этом и кроется глобальная проблема при применении ООП для анализа естественного языка – невозможность заранее предвидеть все возможные сущности, а также зарезервировать для них абстрактные места в будущей системе связей.

То есть такие семантические анализаторы могут развиваться и масштабироваться только до того уровня, который предусмотрели их разработчики.

Ниже – пример разбора в целом корректной фразы, однако состоящей из заведомо неизвестных слов «Я наизобретировываю пять бокрячьих изобретений» одним из самых известных анализаторов на русском языке:

Наш же семантический анализатор позволяет моделировать слова еще до выделения классов и продумывания отношений, требуемых для решения той или иной задачи.

Как следствие – создается универсальный фундамент, который может быть использован для решения совершенно любой последующей задачи.

bookmark_borderСила свойство-ориентированного подхода при семантическом анализе текста

Одной из наиболее масштабных попыток создать семантический анализатор, используя традиционные подходы, можно назвать проект компании ABBYY. Их разработка, Compreno, обошлась примерно в 1 млрд. руб., но в итоге проект был закрыт. Подробнее почитать можно, например, тут и тут.

В чем же отличие нашего подхода к построению семантической модели текста, которое позволяет гибко разбирать текст из различных предметных областей?

Вопрос действительно серьезный. На наш взгляд, главная проблема всех прошлых попыток была в используемой системе понятий с которой пытались соотнести слова текста.

Выбиралась онтология, представляющая ту или иную предметную область во всем богатстве объектов, свойств и взаимосвязей. То есть, например, для описания понятия, стоящего за словом «собака», требовалось создать класс «собака», связать его с другими классами («животное») и описать допустимые свойства («порода», «возраст» и другие).

При этом, даже описав все потенциальные понятия и их взаимосвязи, все равно при анализе текста могли возникать ситуации, когда смысл фразы не укладывался в используемую онтологию. Как следствие — необходимость заново перестраивать всю проработанную систему связей.

Наше же ключевое отличие — возможность моделирования понятий на базовом уровне, вне конкретной предметной области. Такой подход характерен для человека и, например, именно это позволяет ребенку, впервые услышав какое-то слово, начать его использовать без понимания всех оттенков его смысла. Или уловить смысл в известной фразе «Гло́кая ку́здра ште́ко будлану́ла бо́кра и курдя́чит бокрёнка»

Этот базовый смысл слов связан с тем, что мы называем свойство-ориентированным представлением информации мозгом. Определив понятие, соответствующее слову в рамках этой базовой онтологии состоящей из очень ограниченного числа концепций, мы уже получаем возможность строить взаимосвязи между понятиями не ограничиваясь какой-то конкретной онтологией более высокого уровня.

Схематично граница моделирования классического, объектно-ориентированного подхода, показана на рисунке ниже.

При практической реализации семантического анализатора мы применяем ограниченное число понятий уровня предметных областей, но вызвано это исключительно необходимостью корректного разрешения неоднозначностей допускаемых языком. И многие понятия, например, соответствующие прилагательным, могут создаваться автоматически, используя только онтологию базового уровня.

bookmark_borderПродолжаем совершенствовать сайт Text2Grah

После ряда проблемных интервью определили явный запрос на доработку сайта Text2Graph.

Общаясь внутри команды или с подготовленными и знакомыми со свойство-ориентированным подходом коллегами складывалось впечатление, что одного преобразования текста в граф должно быть достаточно, чтобы сторонний наблюдатель оценил силу технологии.

Однако на практике все выглядит несколько по-другому.

Цепочка выводов «неструктурированный текст -> модель ->требуемая информация» попросту не возникает у неподготовленного наблюдателя.

Человек видит текст, видит модель, но понять что граф позволяет решить его проблемы непогруженному в тематику человеку тяжело.

Тезис о запросе более доступного описания мы слышали уже неоднократно, и первым шагом в этом направлении был раздел, с вариантами построения моделей из неструктурированного текста в трех разных предметных областях.

Поняли, что этого недостаточно и сейчас внесли два существенных дополнения.

Первое – под визуальным интерфейсом добавили таблицу с одним из вариантов обработки модели – поиском всех действий, их исполнителей и объектов. Например, введя фразу «Клиент берет деньги в кредит у банка и получает статус квалифицированного инвестора» на выходе получаем таблицу с двумя действиями, участником которых является «клиент».

Второе – раздел с предразобранными вариантами текста также дополнили итоговыми таблицами, демонстрирующими какую информацию можно извлекать. Для фрагмента новости – это участники и контекст, для преамбулы договора – наименования и реквизиты сторон, для приказа – матрица поручений.

Основная задача этих дополнений – сделать информацию о продукте и технологии более доступной и понятной, чтобы совершенно неподготовленный посетитель увидел, как анализируя текст наш семантический анализатор может решать именно его задачи и выдавать результат в понятном ему виде.  

bookmark_borderЦифровой завтрак

Недавно приняли участие в мероприятии «Цифровой Завтрак», организованном в рамках проекта «Выбирай Свое».

Это пока еще молодая площадка, на которой предприниматели имеют возможность рассказать про себя, поделиться опытом и обменяться контактами.

Собственно воспользовались предоставленной возможностью и выступили с докладом про семантический анализатор Real AI SA. А учитывая достаточно гибкий формат «Цифрового Завтрака» часть выступления посвятили применяемой нами технологии и ее ключевым отличиям от нейросетевых решений.

При этом из всех преимуществ, таких как, например, низкая потребность к ресурсам для работы или более легкое обучение, не требующее массивов размеченных данных, наибольший интерес у аудитории вызвала 100 % повторяемость результата обработки текста.

Любопытным и достаточно неожиданным показался доклад коллег из юридической сферы.

Они представили не конкретный продукт или решение, а методологию для регламентирования работы с нейросетями в крупных организациях. По их данным – в настоящее время проблема неконтролируемого доступа к различным сервисам больших языковых моделей приводит к утечкам огромных массивов информации. В таких условиях регламентация становится важным инструментом, направленным на снижение рисков и ответственности для руководителей высшего уровня.