Обзор за 5 секунд
Работа описывает, как разложить математическую меру различия между текстами на вклады отдельных слов и выделить те, которые сильнее всего влияют на это различие.
Краткое содержание
Стилометрические расстояния, например Дельта Берроуза, помогают определять авторство и группировать тексты по авторам, сравнивая их векторные представления. Но какие именно слова в этих векторах сильнее всего влияют на различие между конкретными текстами или их группами?
Дельта Берроуза описывает степень отличия двух текстов как расстояние между их стандартизированными частотными векторами:
Здесь и далее используем Дельту без деления на число выбранных слов n. При фиксированном наборе слов это меняет только масштаб, но не порядок расстояний.
Каждая координата z — частота одного слова, приведённая к общему масштабу. Из относительной частоты p вычитаем среднюю по корпусу μ и делим на стандартное отклонение σ этого слова:
До финального суммирования расстояние рассчитывается отдельно для каждого слова. При вычитании среднее сокращается, и вклад слова i можно записать так:
Значит, можно оценить вклад каждого слова, сравнить его с остальными и выделить наиболее сильные лексические сигналы, по которым метод различает стили.
Условный пример на трёх словах
Возьмём два условных текста. Числа ниже придуманы для объяснения формулы и не являются результатами сравнения писателей.
| Слово | z в T₁ | z в T₂ | Вклад δ |
|---|---|---|---|
| давеча | 2 | 0 | 2 |
| шёпотом | 0 | 1 | 1 |
| и | 0,5 | 0,5 | 0 |
Дельта равна 2 + 1 + 0 = 3. В этом примере «давеча» даёт две трети расстояния, «шёпотом» — одну треть, а «и» не вносит вклада, поскольку его частоты совпадают.
Формулы и разложение: раздел 2 и раздел 4 статьи.
Как устроен подход
Представляем тексты
Строим сопоставимые частотные профили: одинаковая предобработка и общий набор признаков.
Сравниваем профили
Начинаем с классических расстояний: Дельты Берроуза, евклидовой и косинусной Дельты. Затем тестируем дивергенцию Jensen–Shannon на вероятностных распределениях, полученных из нецентрированных стандартизированных частот, и ранговую турбулентность, разработанную P. S. Dodds и коллегами, — на соответствующих рангах слов. Так получаем Jensen–Shannon Delta и Rank-Turbulence Delta.
Изучаем вклад слов
Раскладываем сравнение на вклады токенов и проверяем, как меняется интерпретация при выборе признаков и изменениях данных.
Как читать график
На графике сравниваются стили Фёдора Достоевского и Льва Толстого. Для каждого автора усредняем стандартизированные частотные векторы его произведений, а затем раскладываем расстояние между двумя авторскими профилями на вклады слов.

Открыть график в полном размере · Источник графика
Оранжевые столбцы слева — Достоевский. Синие справа — Толстой. Длина столбца показывает величину вклада слова, а направление — автора, в чьём профиле это слово имеет больший вес. Столбец слева не означает отрицательного расстояния.
Например, Дельта Берроуза выделяет на стороне Достоевского «давеча» и «давешний», на стороне Толстого — «шопотом» (написание в корпусе) и «нынче». Каждая панель показывает одну и ту же пару авторов через другую меру, поэтому самые заметные слова меняются. У панелей свои шкалы: численные величины между ними напрямую несопоставимы.
Попробовать на своих текстах
В репозитории есть ноутбуки, зависимости и инструкции по воспроизведению. Начните с готового анализа, изучите частотные профили и графики вкладов, затем адаптируйте обработку к корпусу с понятным вам составом.
Код и ноутбуки ↗Как цитировать
Rank-Turbulence Delta and interpretable approaches to stylometric Delta measures. Digital Scholarship in the Humanities, 41(3), 1616–1630.
BibTeX
@article{pronin2026rank,
author = {Pronin, Dmitry and Kazartsev, Evgeny},
title = {Rank-Turbulence Delta and interpretable approaches to stylometric Delta measures},
journal = {Digital Scholarship in the Humanities},
year = {2026},
volume = {41},
number = {3},
pages = {1616--1630},
doi = {10.1093/llc/fqag072}
}