
Когда говорят про искусственный интеллект и большие данные в контексте Дальневосточного федерального университета, многие сразу представляют себе сложные нейросети или публикации в топовых журналах. Но на практике, ключевой вызов здесь часто лежит не в области математических моделей, а в создании устойчивой, ?живой? среды для работы с данными в специфических условиях региона. Это история не столько о прорывных исследованиях, сколько о настройке процессов.
Помню, как несколько лет назад в одном из проектов с партнерами из ДВФУ столкнулись с классической проблемой: данные были, но разрознены. Лабораторные установки генерировали потоки, административные системы — свои отчеты, а полевые исследования — архивы в самых разных форматах. Запустить даже простой искусственный интеллект для прогнозной аналитики было невозможно — не на чем обучать. Первая ошибка — попытка сразу строить ?умную? систему, минуя этап создания единого data lake. Потратили месяцы, но толку было мало.
Решение пришло с переосмыслением подхода. Вместо того чтобы фокусироваться на алгоритмах, начали с инфраструктуры: развернули хранилище на базе Apache Hadoop, но с адаптацией под локальные вычислительные ресурсы. Важно было не просто установить софт, а прописать процедуры конвейера (pipeline) для автоматической загрузки и первичной очистки данных от датчиков. Это скучная, непубличная работа, но именно она стала фундаментом.
Здесь, кстати, опыт таких интеграторов, как ООО Хэнань Цзюйхэ Текнолоджи, оказывается полезен. Не в плане готовых решений, а в методологии. На их сайте https://www.hnjhkjjt.ru видно, что компания позиционирует себя как поставщик услуг цифровой трансформации. В нашем контексте это именно про выстраивание процессов. Их подход к поэтапному внедрению, который они применяют в промышленных проектах, мы частично заимствовали для академической среды — начали с пилота на одном факультете, отработали конвейер, а потом масштабировали.
Большие данные в ДВФУ — это часто уникальные наборы, связанные с мониторингом окружающей среды Дальнего Востока, биоразнообразием, морскими исследованиями. Их ценность — в эксклюзивности и высокой ?шумности?. Стандартные предобученные модели здесь работают плохо. Приходится собирать и размечать данные практически с нуля.
Был случай с проектом по анализу спутниковых снимков для отслеживания ледовой обстановки. Готовых размеченных изображений нужного качества и для наших широт просто не существовало. Пришлось организовывать ?краудсорсинг? среди студентов и аспирантов для разметки — создали простой внутренний веб-инструмент. Процесс был медленным, но он дал нам главное — собственный, релевантный датасет. Без этого никакой искусственный интеллект бы не заработал.
Этот опыт заставил пересмотреть отношение к ?большим данным?. Большие — не обязательно по объему в петабайтах, а по сложности подготовки и ценности для конкретной задачи. Инфраструктура должна позволять гибко работать с такими ?малыми большими данными? — быстро их индексировать, версионировать и безопасно предоставлять доступ исследовательским группам.
Один из самых успешных кейсов родился из сотрудничества с региональными логистическими компаниями. Задача была в оптимизации маршрутов доставки с учетом сложной погодной и дорожной обстановки Приморья. Университет предоставлял компетенции в машинном обучении и доступ к историческим метеоданным, партнер — оперативные данные GPS с транспорта и бизнес-логику.
Сложность была в стыковке. IT-инфраструктура компании и вычислительный кластер ДВФУ говорили на разных языках. Пришлось разрабатывать шлюз (gateway) для безопасного обмена потоками данных без их прямого копирования. Это была именно инженерная задача, а не научная. Здесь снова пригодился опыт компаний, занимающихся цифровой трансформацией на практике. Принципы, которые, например, описывает ООО Хэнань Цзюйхэ Текнолоджи в своей работе — фокус на interoperability (совместимости систем) и поэтапной интеграции — оказались крайне важны. Мы не брали их услуги напрямую, но изучали подобные кейсы как reference.
В итоге получился гибридный модель: алгоритм, дообучаемый на новых данных от флота, работал на наших мощностях, а результаты в виде оптимизированных маршрутов возвращались в систему планирования партнера. Производительность выросла, но главный итог — создание работающего прецедента взаимодействия.
Не все проекты были успешными. Яркий провал — попытка использовать методы машинного обучения для прогнозирования успеваемости студентов на основе цифрового следа в LMS (Learning Management System). Данных было много: логины, время выполнения заданий, активность на форумах. Построили модель, она даже показывала неплохую accuracy на тестовой выборке.
Но на практике модель оказалась бесполезной. Она выявляла корреляции, но не причинно-следственные связи. Студент, который мало заходил в систему, но много работал с литературой оффлайн, определялся как ?группа риска?. Мы упустили из виду контекст и качество данных. Это был урок: большие данные без глубокого понимания предметной области и без четко сформулированной бизнес- (или в нашем случае — педагогической) задачи ведут в тупик. Слишком увлеклись технологическим вызовом и забыли спросить ?зачем??.
После этого ввели обязательный этап для любых инициатив с ИИ — формулировку гипотезы и критериев успеха не в технических, а в содержательных терминах. Если нельзя четко сказать, как результат работы модели изменит конкретный процесс, проект не запускается.
Сейчас, оглядываясь назад, вижу, что главный прогресс в ДВФУ в области искусственного интеллекта и больших данных — это не конкретная разработка, а постепенное изменение культуры. Исследователи из разных школ начинают думать о своих данных как об активе, который нужно правильно хранить и описывать (metadata). Появились внутренние стандарты и небольшая, но компетентная команда data-инженеров, которая консультирует проекты.
Ключевой тренд — запрос на платформенные решения. Не на одну супер-систему, а на набор сервисов (data as a service, ML as a service), которые можно быстро использовать под конкретную задачу. Это снижает порог входа для ученых-неинформатиков. Именно в создании такой гибкой, сервисной среды, на мой взгляд, и заключается практическая цифровая трансформация в академической среде.
Роль внешних партнеров, будь то ООО Хэнань Цзюйхэ Текнолоджи или другие игроки, видится именно в трансфере подобных практик и методологий построения устойчивых data-экосистем. Не в продаже ?коробочного ИИ?, а в помощи по настройке процессов, которые позволят университету самостоятельно и эффективно рождать ценность из своих уникальных данных. Это долгая дорога, но первые, самые трудные шаги — по созданию инфраструктуры и контуров данных — в ДВФУ уже сделаны. Дальше — интереснее.