• A
  • A
  • A
  • АБВ
  • АБВ
  • АБВ
  • А
  • А
  • А
  • А
  • А
Обычная версия сайта

«Сегодня сделать большую языковую модель — это гигантский труд»

«Сегодня сделать большую языковую модель — это гигантский труд»

Фото: wtcmoscow.ru

С 22 по 24 ноября проходит международная онлайн-конференция в сфере технологий искусственного интеллекта AI Journey 2023. В ее работе приняли участие эксперты НИУ ВШЭ. В фокусе обсуждения — языковые модели и методы, которые применяются сегодня для обучения искусственного интеллекта.

Научный сотрудник Международной лаборатории интеллектуальных систем и структурного анализа факультета компьютерных наук НИУ ВШЭ Елизавета Гончарова выступила с докладом «Языковые модели. Что можно выучить, генерируя текст?». Она рассказала об истории развития процесса обработки естественного языка и больших языковых моделей как виртуальных ассистентов. По ее словам, начало этому направлению было положено еще в середине прошлого столетия, но применяемые тогда подходы главным образом были основаны на правилах, связанных с формальной грамматикой и регулярными выражениями. «Однако впоследствии нейросетевые подходы по обработке естественного языка и трансформерные модели взяли верх, и все большие и наиболее успешные примеры работ моделей по обработке естественного языка теперь связаны именно с архитектурой трансформеров», — отметила исследовательница.

Елизавета Гончарова

Елизавета Гончарова считает, что большие языковые модели очень мощные, поэтому, будучи предобученными на простой задаче языкового моделирования, они способны решать гораздо более сложные прикладные задачи даже без дальнейшего обучения. «Если заглянуть внутрь модели, то мы увидим, что каждая часть модели отвечает за кодирование и своей информации, и той информации, на которую мы посягаем как люди: лингвистической структуры текста, фактологии, понятий времени и пространства и даже визуальных концептов, в целом закодированных внутри модели, которую мы рассматриваем, — объяснила она. — Добавление на дообучение модели данных других модальностей позволяет лучше улавливать понятия, связанные с этими модальностями, как в случае цветов, так и в случае форм. Это намекает нам на то, что текстов недостаточно, чтобы модель получила все знания о мире. Возможно, расширение модальности позволит нам открыть новые формы моделей и перейти к более сложным и более умным моделям, которые мы будем использовать в будущем».

Об алгоритмах, которые применяются для создания языковых моделей, используемых искусственным интеллектом, рассказал Евгений Соколов, руководитель департамента больших данных и информационного поиска, доцент факультета компьютерных наук, научный руководитель Центра непрерывного образования НИУ ВШЭ. Тема его доклада — «Tехнологии и алгоритмы внутри больших языковых моделей, или Что сегодня понимают под ИИ?». Евгений Соколов отметил, что сегодня уже много информации об успехах ИИ, генеративных моделей, больших языковых моделей. Он предложил разобраться, как они работают, что находится внутри, какие алгоритмы делают возможными все эти результаты и за счет чего происходит рост качества в методах ИИ.

Евгений Соколов

«Сегодня сделать большую языковую модель — это гигантский труд. Да, математика, которая лежит в основе, очень простая: производные, градиенты, градиентный спуск. А дальше начинается много интересного, нужно придумать методы для извлечения информации из данных, — говорит Евгений Соколов. — Сейчас есть трансформеры, но, кто знает, может, завтра придумают что-то новое? Очень важны сегодня обучающие данные. Классическая парадигма — это когда мы берем обучающие данные и подкручиваем параметры какой-то модели, какого-то алгоритма, чтобы получилось получше. Но сейчас этого мало, недостаточно. Нам нужно как-то внедрить требования качества в эту модель. Для этого мы берем асессоров, собираем большую выборку, строим отдельную оценивающую модель, что требует тоже очень много времени, и на основе этого докручиваем параметры нашей большой языковой модели. Получается сложная схема, какой мы видим ее сегодня. И это то, как сейчас обучаются большие языковые модели».

Эксперт отметил, что в этой работе главную роль играет не решение задачи, чтобы модель как-то «догадалась», что разработчики в нее заложили какие-то глубокие понимания — например, понимание того, как устроен язык. В этой работе важны два момента — собрать качественные данные и взять модель побольше. По его мнению, последние годы исследований показали, что основной рост качества языковых моделей достигается за счет определения большего количества параметров, по которым в дальнейшем будет вестись разработка большой языковой модели.

Свои доклады на конференции также представили и другие исследователи из Вышки. Так, младший научный сотрудник Института искусственного интеллекта и цифровых наук Айбек Аланов выступил с докладом «Редактирование изображений с помощью диффузионных моделей». Сотрудник Института искусственного интеллекта и цифровых наук и Научно-учебной лаборатории методов анализа больших данных НИУ ВШЭ Виталий Поздняков представил доклад на тему «Генерация стрессовых данных для проверки устойчивости моделей». Доцент факультета компьютерных наук, сотрудник Международной лаборатории интеллектуальных систем и структурного анализа НИУ ВШЭ Дмитрий Ильвовский сделал сообщение на тему «Интерпретируемые подходы к дискурсивным, логическим и аргументативным структурам в тексте». А профессор НИУ ВШЭ в Нижнем Новгороде Андрей Савченко представил исследование «Эффективные методы распознавания выражений лиц на видео».

В форсайт-сессии «ИИ для человека будущего» выступил Александр Чулок, директор Центра научно-технологического прогнозирования ИСИЭЗ НИУ ВШЭ.

Вам также может быть интересно:

ФКН ВШЭ и ЧГУ реализовали три отраслевых образовательных модуля по искусственному интеллекту

В 2025/26 учебном году факультет компьютерных наук (ФКН) ВШЭ совместно с Череповецким государственным университетом реализовал три отраслевых образовательных модуля по искусственному интеллекту. Инициатива была представлена в рамках проекта «Топ-ИИ» Минцифры России при участии АНО «Аналитический центр при Правительстве Российской Федерации». Эксперты НИУ ВШЭ совместно с индустриальными партнерами разработали линейку отраслевых образовательных модулей в области искусственного интеллекта.

Новый метод НИУ ВШЭ и Т-Технологий повышает качество работы ИИ

Ученые из лаборатории научных исследований «Т-Технологий» и Института искусственного интеллекта и цифровых наук факультета компьютерных наук НИУ ВШЭ разработали новый метод семплирования для моделей маскированной диффузии — G-Star+. Он помогает быстрее и качественнее исправлять ошибки во время генерации текста и кода за небольшое число шагов. Метод показал эффективность в задачах генерации текста и кода и может применяться там, где генеративным моделям нужно быстро и качественно создавать текст или код при ограниченных вычислительных ресурсах.

В Вышке открыли проектно-учебную лабораторию совместно с Группой «Т-Технологии»

Группа «Т-Технологии» (головная структура Т-Банка) открыла проектно-учебную лабораторию на базе факультета компьютерных наук НИУ ВШЭ (ФКН НИУ ВШЭ). Проектно-учебная лаборатория Группы «Т-Технологии» в НИУ ВШЭ сосредоточится на проектах и задачах в области искусственного интеллекта, распределенных вычислений, анализа больших данных и информационной безопасности в финансовом секторе. Лабораторию возглавит Алексей Теплов, кандидат физико-математических наук.

«Защищать конкуренцию от ИИ нам придется с помощью самого искусственного интеллекта»

В НИУ ВШЭ прошел двухдневный семинар «Искусственный интеллект и конкурентная политика в странах БРИКС». Его участники обсудили две ключевые для конкурентной политики темы: трансформация конкуренции и рынков под влиянием технологий ИИ и усилени е регуляторного потенциала антимонопольных органов за счет технологий искусственного интеллекта.

В НИУ ВШЭ разработали сервис обезличивания табличных данных для безопасного использования в ИИ-системах

Институт искусственного интеллекта и цифровых наук ФКН ВШЭ разработал сервис обезличивания табличных данных, предназначенный для подготовки корпоративных данных к использованию в аналитических и ИИ-сервисах. Решение позволяет выявлять персональные данные в структурированных наборах, применять к ним воспроизводимые правила обезличивания и формировать артефакты, необходимые для контроля качества, аудита и последующего использования данных в защищенных контурах.

Высшая школа экономики и «Ростелеком» поддержат ИИ-стартапы для госсектора

НИУ ВШЭ и «Ростелеком» подписали на ПМЭФ-2026 соглашение о сотрудничестве в рамках реализации акселератора ИИ-решений для государственного сектора. Совместная работа позволит объединить технологическую экспертизу крупнейшего цифрового партнера государства и академический потенциал ведущего исследовательского университета страны.

Проблемы этики: как и где использовать ИИ

За последние годы этика в сфере искусственного интеллекта превратилась из философско-теоретической в прикладную дисциплину. Эксперты в НИУ ВШЭ обсудили, какие этические проблемы возникают в связи со стремительным развитием цифровизации и какие их инженерные решения могут быть предложены.

НИУ ВШЭ и МТС договорились об обмене ИИ-компетенциями при подготовке инженерных кадров для телекома

НИУ ВШЭ и ПАО «МТС» заключили соглашение о стратегическом партнерстве, которое предполагает подготовку кадров с ИИ-компетенциями для телекоммуникационной отрасли по программам высшего и дополнительного профессионального образования. Соглашение направлено на повышение качества образования, обмен экспертизой и компетенциями при подготовке инженеров, владеющих технологиями ИИ и машинного обучения.

Точка входа в ИИ: на ЦИПР обсудили влияние технологий на будущее

Участники ЦИПР-2026 обсудили, как офисные приложения могут стать точкой массового доступа к ИИ и снизить барьеры использования. Эксперты сошлись во мнении, что будущее — за адаптивными моделями и экосистемным подходом к корпоративным данным. В экспертных дискуссиях приняли участие представители НИУ ВШЭ.

ФКН ВШЭ расширяет линейку образовательных программ по ИИ для руководителей

Центр непрерывного образования факультета компьютерных наук НИУ ВШЭ (ЦНО ФКН ВШЭ) развивает уникальную линейку образовательных продуктов для топ-менеджмента, где передовая компьютерная наука соединяется с реальными задачами бизнеса. Цель этого направления — помогать развивать бизнес в России через внедрение технологий искусственного интеллекта.