• A
  • A
  • A
  • АБВ
  • АБВ
  • АБВ
  • А
  • А
  • А
  • А
  • А
Обычная версия сайта

Научить машину читать прошлое: на ФГН создают нейросеть для расшифровки рукописей

Рукопись драматурга А.В. Сухово-Кобылина

Рукопись драматурга А.В. Сухово-Кобылина
Источник: Российский государственный архив литературы и искусства

Дневники и письма — бесценный источник для гуманитария-исследователя. Но что делать, если текст невозможно прочитать? На факультете гуманитарных наук (ФГН) ВШЭ эту проблему решили перевести на язык математики: команда филологов, историков и специалистов по машинному обучению создала информационную систему, которая не только распознает неразборчивый почерк, но и помогает анализировать содержание архивов.

История вопроса

Работа с рукописными источниками на факультете имеет давнюю традицию. Ее новый технологический этап начался в 2019 году, когда Высшая школа экономики подключилась к проекту «Автограф» под руководством Елены Пенской (сейчас — руководитель Центра цифровых архивных исследований ФГН). Проект появился в 2014 году благодаря группе исследователей Российского государственного архива литературы и искусства. Практически сразу проект, позволяющий студентам, ученым и просто любителям литературы со всего мира изучать электронные копии рукописей, поддержал Пушкинский Дом и Российский научный фонд (РНФ).

В 2022 году группа участников «Автографа» решила идти дальше. Они подали новую заявку в РНФ и выиграли грант на междисциплинарный и межуниверситетский проект «Культурное наследие России: интеллектуальный анализ и тематическое моделирование корпуса рукописных текстов». К работе подключились историки, математики и филологи из ВШЭ и их давние партнеры из Томского госуниверситета.

Елена Пенская
Фото: Высшая школа экономики

Цель была амбициозной: разработать цифровые инструменты, которые превращают хаотичные массивы рукописей (дневники, письма, эго-документы XIX — начала XX века) в структурированные данные с помощью алгоритмов машинного обучения. Речь шла не просто об оцифровке, а об автоматическом выявлении скрытых тем, сюжетов и смыслов, каталогизации и интеллектуальном анализе архивов.

Проект формально завершился в 2025 году, но исследования продолжаются. Елена Пенская и кандидат физико-математических наук Никита Ломов создали работающую информационную систему. Ее главная задача — научить машину читать нечитаемое.

Как это работает: строки, сущности и нейросеть YOLO-HTR

Традиционная систематизация рукописей в архивах и библиотеках основана на распределении документов по фондам, листам, единицам хранения и нумерации страниц. Оцифровка добавляет навигацию по картинкам — это полезно, но не решает главной проблемы: текст остается нераспознанным.

Система, разработанная на ФГН, идет на два шага вперед. Она использует оригинальную архитектуру нейросети YOLO-HTR (You Only Look Once + Handwritten Text Recognition), которая одновременно решает две задачи: находит строки текста на изображении и расшифровывает их. В результате каждая строка рукописи оказывается связанной не только с номером страницы, но и с тем, что на ней написано.

Но это только полдела. Главное — семантическая навигация. С помощью больших языковых моделей система выделяет в тексте так называемые сущности: не только традиционные «персоны», «локации» или «организации», но и более сложные категории — «состояние здоровья», «политическое событие», «размышление». Пользователь может кликнуть на любую сущность и мгновенно получить все строки и страницы, где она упоминается. Это превращает архив из стопки картинок в связную базу знаний с двунаправленными перекрестными ссылками.

«Мы получаем организацию архива по содержанию, — объясняет Никита Ломов. — От предметов интереса можно переходить к конкретным строкам и страницам, а для страницы и ее строк мы имеем построчный список упоминаемых сущностей».

Дневники Сухово-Кобылина: вызов, который длился 40 лет

Один из самых ярких кейсов — дневники драматурга Александра Васильевича Сухово-Кобылина (1817–1903). Личность загадочная: подозревался в убийстве своей возлюбленной-француженки, написал три пьесы, вошедшие в русский литературный канон, и почти не публиковал дневники при жизни.

Сами дневники при их внушительном объеме опубликованы лишь частично. Расшифровка опубликованной части заняла около 40 лет, и даже в ней остались пропуски и неточности. Почерк Сухово-Кобылина настолько неразборчив, что может сбить с толку неподготовленного человека.

Рукопись драматурга А.В. Сухово-Кобылина
Источник: Российский государственный архив литературы и искусства

Команда ФГН загрузила в систему 380 страниц дневников — это более 10 тысяч строк текста, из которых около 5 тысяч имели опубликованную расшифровку (она использовалась для обучения нейросети). Для сравнения: почерки Федора Литке и Модеста Корфа система распознает с ошибкой 3–5% в буквах. Для Сухово-Кобылина ошибка достигает 10% в буквах и 28% в словах.

Но даже этот результат, подчеркивают разработчики, является огромным подспорьем для исследователя. Большинство ошибок исправляются очевидным образом, а сам текст становится легкочитаемым там, где раньше приходилось гадать по несколько минут на каждое слово.

Диалог с машиной: как задавать вопросы архиву

Современные большие языковые модели (ChatGPT, DeepSeek, Gemini, Claude) позволяют общаться с ними почти как с живым собеседником. Разработчики ФГН пошли дальше: они адаптировали этот формат для работы с архивом.

Исследователь может сформулировать запрос на естественном языке («покажи все упоминания болезней в 1850-е годы» или «выдели поездки с указанием маршрута и спутников»), а система вернет не связный текст, а структурированный список — с полями, пригодными для дальнейшего анализа. Это позволяет отслеживать временную динамику упоминаний, выявлять совместные появления сущностей, реконструировать социальные связи, конфликты и перемещения.

«Здесь многое зависит от пожеланий и устремлений коллег-филологов, — говорит Никита Ломов. — Именно их исследовательские интересы определят новые типы поддерживаемых запросов и приведут к расширению возможностей нашей системы».

Масштабирование и научное сообщество

Разработчики видят два параллельных пути развития системы.

Экстенсивный — наращивание объемов данных. Создание аналогичных систем для других коллекций эго-документов, особенно тех, для которых уже есть текстовая расшифровка.

Интенсивный — улучшение алгоритмов. Меньше ошибок распознавания, меньше потребность в размеченных данных, более точное выделение сущностей даже при неточной расшифровке.

Но главное условие успеха — появление сообщества заинтересованных пользователей. Пока система работает в исследовательском режиме. Чтобы всерьез говорить о масштабировании, нужны сотни активных исследователей, историков, филологов, студентов, которые будут не просто смотреть, а формулировать запросы, предлагать новые типы сущностей и проверять гипотезы.

«Хотелось бы, чтобы вокруг подобных систем сложилось определенное сообщество, — говорит Никита Ломов. — Только когда число по-настоящему заинтересованных пользователей станет исчисляться сотнями, можно будет всерьез поставить вопрос о масштабировании».

Информационная система уже доступна по ссылке (на примере дневников Сухово-Кобылина).

Проект продолжается в рамках Программы фундаментальных исследований НИУ ВШЭ 2026 года («Язык, литература и культура в историческом и социальном измерении»). Присоединиться к тестированию и сотрудничеству можно через Центр цифровых архивных исследований ФГН.

Вам также может быть интересно:

В НИУ ВШЭ появится суперкомпьютер для работы с ИИ

Высшая школа экономики готовит к запуску второй суперкомпьютер. Новый кластер будет ориентирован прежде всего на задачи ИИ и дополнит уже действующий суперкомпьютер cHARISMa. Его запуск планируется на конец 2026 года.

В НИУ ВШЭ создан Фонд науки и технологий

Фонд науки и технологий НИУ ВШЭ (ФНТ) будет финансировать перспективные научные инициативы, имеющие прикладную направленность и содействующие достижению технологического лидерства России. На поддержку могут рассчитывать проектные команды из всех кампусов университета. Заявку в ФНТ можно подать в любой момент. Рассматривать заявки будет созданный Совет по науке и технологиям НИУ ВШЭ.

Нейросеть НИУ ВШЭ iFORA.LLM включена в Реестр российского программного обеспечения

Адаптированная большая языковая модель для сферы науки, технологий и инноваций (далее — iFORA.LLM, модель), разработанная экспертами Института статистических исследований и экономики знаний НИУ ВШЭ, включена в Реестр российского ПО. Модель создана для эффективного анализа массивов научно-технической информации — от поиска релевантных публикаций до оценки технологических трендов и формирования аналитических отчетов.

Новый метод НИУ ВШЭ и Т-Технологий повышает качество работы ИИ

Ученые из лаборатории научных исследований «Т-Технологий» и Института искусственного интеллекта и цифровых наук факультета компьютерных наук НИУ ВШЭ разработали новый метод семплирования для моделей маскированной диффузии — G-Star+. Он помогает быстрее и качественнее исправлять ошибки во время генерации текста и кода за небольшое число шагов. Метод показал эффективность в задачах генерации текста и кода и может применяться там, где генеративным моделям нужно быстро и качественно создавать текст или код при ограниченных вычислительных ресурсах.

Студенты МИЭМ ВШЭ разработают два спутника собственной конструкции для орбитальных экспериментов

Аппараты, созданные студенческими командами, проведут в условиях космоса исследования свойств перспективных солнечных элементов, бортовых систем накопления энергии и серийной электроники для студенческих спутников.

В Вышке открыли проектно-учебную лабораторию совместно с Группой «Т-Технологии»

Группа «Т-Технологии» (головная структура Т-Банка) открыла проектно-учебную лабораторию на базе факультета компьютерных наук НИУ ВШЭ (ФКН НИУ ВШЭ). Проектно-учебная лаборатория Группы «Т-Технологии» в НИУ ВШЭ сосредоточится на проектах и задачах в области искусственного интеллекта, распределенных вычислений, анализа больших данных и информационной безопасности в финансовом секторе. Лабораторию возглавит Алексей Теплов, кандидат физико-математических наук.

В НИУ ВШЭ создали базу данных по производственным цепочкам мирового ВПК

Институт мировой военной экономики и стратегии (ИМВЭС) НИУ ВШЭ разработал новый аналитический инструмент для изучения оборонной промышленности зарубежных стран. База данных «Производственные цепочки мирового ВПК» показывает взаимосвязи между производителями на разных уровнях — от конечных систем до комплектующих.

Институт робототехнических систем ВШЭ запустил научно-технический семинар

Институт робототехнических систем (ИРС) ВШЭ запустил новый ежемесячный формат — Научно-технический семинар. Он объединяет сотрудников института, приглашенных экспертов, студентов, исследователей и представителей других подразделений НИУ ВШЭ для обсуждения актуальных задач мехатроники, робототехники и киберфизических систем.

В НИУ ВШЭ разработали сервис обезличивания табличных данных для безопасного использования в ИИ-системах

Институт искусственного интеллекта и цифровых наук ФКН ВШЭ разработал сервис обезличивания табличных данных, предназначенный для подготовки корпоративных данных к использованию в аналитических и ИИ-сервисах. Решение позволяет выявлять персональные данные в структурированных наборах, применять к ним воспроизводимые правила обезличивания и формировать артефакты, необходимые для контроля качества, аудита и последующего использования данных в защищенных контурах.

«Дни компьютерных наук год от года становятся масштабнее, и это отражает развитие ФКН»

Прошедший недавно в корпусе НИУ ВШЭ на Покровке фестиваль «Дни компьютерных наук» (ДКН) стал главной точкой притяжения для всех, кто интересуется технологиями. Событие, организованное факультетом компьютерных наук (ФКН) Вышки совместно с партнерами, собрало около трех тысяч участников: студентов, абитуриентов, выпускников, преподавателей и экспертов индустрии.