Big Data в исторических исследованиях: обзор главной монографии 2026 года

Автор: Елена Городецкая 7 мин чтения

Новая монография о применении больших данных в исторических исследованиях претендует на роль методологического ориентира для всего сообщества исторической информатики. Авторы систематизируют опыт работы с огромными массивами источников — от переписей XIX века до оцифрованных архивов. Разбираем ключевые тезисы, сильные стороны и дискуссионные моменты книги.

Контекст: почему Big Data пришла в историческую науку

Объём информации в мире растёт экспоненциально. По данным, зафиксированным в рецензируемых источниках, только с 2005 по 2015 год мировой информационный поток увеличился с 4–5 эксабайт до 7 зеттабайт. Большой адронный коллайдер поставляет около 40 терабайт данных в секунду — цифра, которую историки приводят как метафору нового масштаба работы с информацией. На этом фоне появление монографии, посвящённой методам обработки данных применительно к историческому анализу, закономерно.

Само понятие больших данных получило академическое оформление в 2008 году, когда Клиффорд Линч в специальном выпуске журнала Nature охарактеризовал Big Data как массивы разнородных данных объёмом более 150 гигабайт в сутки. С того момента вопрос о том, как адаптировать эти технологии для исторического исследования, не сходит с повестки профессиональных конференций. На XXII Международном конгрессе исторических наук в Китае в 2015 году влияние «цифрового поворота» на историческую науку было заявлено одной из центральных дискуссионных тем.

Рецензируемая монография встраивается в эту традицию, но делает шаг вперёд: авторы не ограничиваются декларациями о перспективах, а предлагают операциональные инструменты. Именно это отличает книгу от большинства методологических сборников последних лет.

Структура и основные разделы монографии

Книга организована по логике, хорошо знакомой специалистам по исторической информатике: от общетеоретических оснований — к прикладным кейсам. Первый раздел посвящён концептуальному аппарату: авторы разбирают, что именно превращает исторический источник в элемент большого массива данных и при каких условиях количественный анализ становится методологически легитимным.

Второй раздел — самый объёмный — разбирает конкретные технологии работы с данными. Среди них особое место занимает MapReduce — технология параллельной обработки, предложенная корпорацией Google ещё в 2004 году. Авторы показывают, как этот инструмент, изначально разработанный для коммерческих задач, адаптируется под нужды исторического архивоведения при работе с распределёнными базами данных.

Третий раздел посвящён конкретным историческим кейсам. Здесь монография особенно убедительна: каждый пример снабжён методологическим комментарием, описывающим не только результат, но и процесс — от формирования базы данных до интерпретации выходных показателей.

Историческая информатика: дисциплинарный фон

Чтобы оценить монографию по достоинству, необходимо понимать дисциплинарный контекст. Историческая информатика как научное направление сформировалась в начале 1990-х годов — непосредственно после «микрокомпьютерной революции» 1980-х. Однако её истоки уходят глубже: ещё в 1960-х годах историки начали создавать первые архивы исторической информации в электронной форме, а применение цифровых технологий в гуманитарных науках США берёт начало с середины 1950-х годов, когда квантитативная история только складывалась как методологическое течение.

В России институциональным воплощением этого направления стала Ассоциация «История и компьютер», информационные бюллетени которой издаются с 1993 года. К настоящему моменту вышло 30 сборников — своеобразная летопись того, как отечественная историческая информатика осваивала информационные технологии. Авторы монографии опираются на эту традицию, хотя и не ограничиваются ею.

Монография предлагает обновлённую периодизацию дисциплины, выделяя три этапа: формирование баз данных (1960–1990-е), переход к сетевым системам и XML-разметке (2000-е) и нынешний этап — интеграция машинного обучения и аналитики данных в исторический процесс исследования.

Ключевые методы: от переписей до литературных корпусов

Демографические данные и антропометрическая история

Один из наиболее детально разобранных в монографии кейсов — работа с материалами переписи 1897 года. Авторы описывают метод, при котором точность указания возраста респондентом (наличие неокруглённых цифр) служит показателем уровня грамотности в отдельных губерниях. Подобный подход требует обработки огромного массива информации, но именно здесь технологии больших данных демонстрируют своё преимущество перед традиционными выборочными методами.

Отдельная глава посвящена антропометрической истории. Историк Борис Миронов использовал данные из рекрутских списков для анализа среднего роста новобранцев как косвенного показателя благосостояния населения в имперской России XVIII — начала XX века. Этот пример авторы используют для иллюстрации принципиальной идеи монографии: исторический источник, не предназначавшийся для статистического анализа, при правильной обработке данных становится полноценным инструментом изучения исторических процессов.

Дальтоническое чтение и литературные массивы

Монография уделяет значительное внимание методу «дальтонического чтения» (distant reading), разработанному Франко Моретти. Его исследование фигуры буржуа в литературе XIX века основывалось на корпусе «Литературной лаборатории», включавшем 3500 британских, ирландских и американских романов. Параллельно использовалась база данных Чэдвик-Хили — 250 британских и ирландских романов XIX века. Это пример того, как аналитика данных позволяет задавать вопросы, принципиально недоступные при традиционном «ближнем чтении».

Авторы не идеализируют этот метод. Они фиксируют его ограничения: дальтоническое чтение хорошо работает на уровне макротенденций, но теряет в точности при интерпретации отдельных текстов. Баланс между массивом данных и детальным анализом источника — один из ключевых методологических вопросов, которым посвящена значительная часть книги.

Технологический инструментарий: что авторы считают обязательным

Монография систематизирует инструментарий исторических исследований в эпоху Big Data. Авторы выделяют несколько технологических уровней, без освоения которых работа с большими массивами данных остаётся декларативной.

  • Реляционные базы данных и SQL. Базовый уровень, необходимый для структурирования исторических источников. Авторы подчёркивают: база данных — это не хранилище, а аналитический инструмент, форма которого определяет, какие вопросы можно задать к материалу.
  • Технологии параллельной обработки данных. MapReduce и его современные аналоги позволяют работать с объёмами, недоступными для последовательной обработки. Для исторической науки это особенно актуально при работе с оцифрованными архивными фондами.
  • Машинное обучение для классификации источников. Авторы разбирают применение алгоритмов машинного обучения к распознаванию рукописей, тематическому моделированию корпусов документов и автоматической датировке текстов.
  • Визуализация данных. Отдельная глава посвящена тому, как визуальное представление аналитики данных меняет восприятие исторических закономерностей — и какие риски несёт упрощение сложных процессов до наглядной инфографики.
  • Математические методы. Авторы настаивают на том, что математические методы — не замена историческому мышлению, а его расширение. Статистический анализ источника не отменяет интерпретации, но делает её основания более прозрачными.

Дискуссионные тезисы и критика

Монография не избегает полемики. Авторы напрямую возражают тем коллегам, которые считают квантитативный подход несовместимым с гуманитарной природой исторического познания. Их аргумент: проблема не в объёме данных, а в качестве вопросов, которые историк задаёт источнику. Большие данные расширяют диапазон возможных вопросов, но не подменяют историческое суждение.

Вместе с тем рецензент не может не отметить уязвимые места. Первое — недостаточное внимание к проблеме репрезентативности оцифрованных архивов. Практическое применение технологий больших данных было ограничено научной сферой до 2011 года, и значительная часть доступных оцифрованных корпусов отражает скорее логику оцифровки (финансирование, доступность, формат), чем реальное распределение исторических источников.

Второе уязвимое место — работа с источниками на неевропейских языках. Инструменты машинного обучения, описанные в монографии, демонстрируют высокую точность на латинице, но существенно уступают при работе с кириллицей, арабским письмом или иероглификой. Авторы признают эту проблему, однако не предлагают системного решения.

Третье замечание касается воспроизводимости исследований. Монография приводит впечатляющие кейсы, но не всегда раскрывает технические детали, необходимые для воспроизведения методологии другой исследовательской группой. Это снижает практическую ценность книги как методического руководства.

Место книги в истории дисциплины

Несмотря на критические замечания, монография занимает важное место в истории исторической информатики. Авторам удалось сделать то, что редко получается в методологических работах: соединить концептуальный анализ с прикладным руководством, не потеряв ни строгости, ни читаемости.

Книга продолжает традицию, восходящую к первым попыткам применить информационные технологии к историческому анализу в середине прошлого века. Вместе с тем она фиксирует качественный сдвиг: если раньше цифровые методы были инструментом обработки уже собранных данных, то сегодня они меняют саму логику формирования исследовательского вопроса.

Для российского читателя особый интерес представляет раздел, посвящённый отечественной традиции исторической информатики. Авторы справедливо указывают, что российская школа — с её вниманием к статистическим источникам и опытом работы с переписями имперского периода — располагает методологическим потенциалом, который пока не в полной мере интегрирован в международный дискурс.

Для кого написана монография

Авторы, судя по всему, ориентировались на несколько аудиторий одновременно. Историки-методологи найдут здесь концептуальный каркас для осмысления «цифрового поворота». Практикующие исследователи получат обзор конкретных инструментов обработки данных с примерами их применения. Преподаватели исторической информатики смогут использовать книгу как структурную основу для курсов по цифровым методам.

Вместе с тем монография предполагает определённый базовый уровень. Читателю без минимальной подготовки в области баз данных и статистического анализа некоторые разделы окажутся сложными для восприятия. Это не недостаток, а осознанный выбор жанра: авторы писали для профессионального сообщества, а не для широкой аудитории.

Итоговая оценка

Монография 2026 года о методах Big Data в исторических исследованиях — серьёзная и своевременная работа. Она систематизирует накопленный опыт, предлагает рабочий инструментарий и честно обозначает границы применимости предлагаемых методов. Для специалистов по исторической информатике и цифровому архивоведению книга станет обязательным чтением.

Критические замечания, высказанные выше, не отменяют этого вывода. Скорее, они обозначают направления, в которых дискуссия должна продолжиться: репрезентативность оцифрованных массивов, мультиязычность инструментов машинного обучения, стандарты воспроизводимости исследований. Именно эти вопросы, по всей видимости, определят повестку исторической информатики в ближайшие годы.

Большие данные не делают историю точной наукой — они делают её аргументацию более проверяемой. Это разные вещи, и монография последовательно держит эту границу.

Журналист, специализирующийся на научной тематике. Более 10 лет освещает события в академической среде для профильных изданий.