Цифровой конструктор для большой науки: в МИФИ создали систему интеллектуального анализа, способную превращать хаос данных в трёхмерные карты знаний

Прочитано: 194 раз(а)


Разработка, ставшая основой докторской диссертации, представляет собой универсальную платформу для извлечения знаний из научных статей, патентов и цифровых профилей. Система, созданная под руководством профессора Алексея Артамонова, уже апробирована в атомной отрасли, медицине и финансовой безопасности.

В Национальном исследовательском ядерном университете «МИФИ» завершена разработка комплексной системы интеллектуального анализа данных, способной работать с неструктурированными и слабоструктурированными массивами информации — от корпусов научных публикаций до цифровых профилей пользователей социальных сетей. Проект, реализованный под руководством доктора технических наук, заведующего кафедрой анализа конкурентных систем НИЯУ МИФИ Алексея Анатольевича Артамонова, стал основой его докторской диссертации и знаменует собой переход к новому методологическому уровню в обработке больших данных.

По словам Алексея Артамонова, классические подходы к хранению и анализу информации часто оказываются неэффективными, когда исследователь имеет дело с разнородными, постоянно обновляемыми источниками. Текст научной статьи — это не изолированный набор слов, а сложная система взаимосвязей между авторами, организациями, тематиками, результатами экспериментов и цитируемыми работами. «Если мы хотим извлекать из таких массивов не просто статистику, а новые предметные знания, необходим иной методологический уровень», — подчеркнул учёный.

Ключевым элементом разработки стал так называемый «универсальный цифровой конструктор», предлагающий различные наборы инструментов и моделей для каждого типа данных. В его основе лежит единая модель цифрового объекта, в рамках которой любой информационный объект — будь то патент, публикация или сообщение в социальной сети — описывается одинаково: у него есть статические свойства (например, дата рождения автора), динамические характеристики (частота публикаций) и вычисляемые параметры (индекс цитируемости). К этому добавляется граф связей с другими объектами. Такая структура обеспечивает единое представление данных из принципиально разных источников, повышает точность и воспроизводимость аналитических результатов и служит основой для построения гибких алгоритмов обработки.

Второй ключевой компонент системы — разработанный комплекс методов преобразования исходной информации. Эти инструменты автоматически извлекают из текста научных статей структурированные данные: физические величины с приведением к единой системе СИ, координаты организаций по аффилиациям авторов, ключевые термины, содержимое таблиц и подписей к рисункам, а также данные о международном сотрудничестве на основе анализа стран-соавторов. В результате исходный массив документов превращается в обогащённую базу знаний, пригодную для количественного и качественного анализа.

Важным элементом системы являются специализированные программные средства визуализации. В частности, реализован инструмент построения гетерогенных графов, позволяющий наглядно отображать связи между публикациями, авторами, организациями и тематиками, выявляя неочевидные кластеры и скрытые закономерности.

Особого внимания заслуживает разработанная методика построения научно-технологических ландшафтов (НТЛ) — трёхмерных интерактивных карт, по осям которых откладываются научные направления, временные интервалы и объёмы публикационной активности. Такие ландшафты дают возможность сравнивать динамику развития различных областей науки по странам и организациям, определять точки роста и оценивать эффективность международной кооперации. По словам разработчиков, подобные инструменты востребованы при принятии управленческих решений на государственном уровне, в том числе в рамках национальных проектов технологического лидерства.

В ближайшей перспективе учёные МИФИ планируют углублённую интеграцию в систему современных нейросетевых моделей. На текущем этапе применяются классические методы машинного обучения и обработки естественного языка, которые эффективны для структурирования фактов, выделения ключевых слов и нормализации величин. Следующим шагом станет переход к тонкому семантическому анализу. «Мы хотим, чтобы система не просто находила числовые значения в тексте, а понимала контекст: различала, когда автор сообщает о результатах собственного эксперимента, а когда цитирует чужую работу; улавливала нюансы тональности в социальных данных; выявляла скрытые взаимосвязи между событиями, которые не лежат на поверхности», — пояснил Алексей Артамонов. Также планируется расширение спектра предметных областей, доступных для анализа.

Система создана в рамках научной школы, возникшей на кафедре анализа конкурентных систем института международных отношений НИЯУ МИФИ. С 2008 года на кафедре проводятся работы по разработке мультиагентных систем обработки научно-технической информации, в рамках которой создаются принципиально новые методы, алгоритмы и программные средства потоковой обработки, анализа, визуализации и доставки целевой информации для различных пользователей. Новая разработка стала логичным продолжением этих исследований и уже прошла апробацию в атомной энергетике, медицине и финансовой безопасности.

В НИЯУ МИФИ подобрали оптимальный режим для внутренних стенок токамака



Новости партнеров