DOI

Предложен новый метод статистического анализа текстов. Исследовано распределение частот различных первых значащих цифр в числительных англоязычных текстов. Учитываются количественные и порядковые числительные, выраженные как цифрами, так и словесно. Предварительно из текста удаляются случайно попавшие в него числительные, не отражающие авторский замысел (номера страниц, маркеры списков, идиоматические выражения, устойчивые обороты речи и тому подобное). Обнаружено, что для сборных текстов разного авторства частоты первых значащих цифр приближенно соответствуют известному закону Бенфорда, но с резким преобладанием встречаемости единицы. В связных авторских текстах возникают характерные отклонения от закона Бенфорда; показано, что эти отклонения являются статистически устойчивыми и значимыми авторскими особенностями, позволяющими при определенных условиях ответить на вопрос об авторстве и различить тексты разных авторов. Требуется, чтобы текст был достаточно длинным (не менее чем порядка 200 кБ). Распределение первых значащих цифр конца ряда {1, 2,..., 8, 9} подвержено сильным флуктуациям и не показательно для нашей цели. Цель теоретического обоснования найденной эмпирической закономерности в работе не ставится, но продемонстрировано ее практическое использование для атрибуции текстов. Предлагаемый подход и сделанные выводы подкреплены примерами компьютерного анализа художественных текстов У. М. Теккерея, М. Твена,Р. Л. Стивенсона, Дж. Джойса, сестер Бронте, Дж. Остин. На основе разработанной методологии рассмотрены проблемы авторства текста, ранее приписывавшегося Л. Ф. Бауму (результат согласуется с полученным другими методами), а также известного романа Харпер Ли «Убить пересмешника»; показано, что к написанию первоначального варианта этой книги («Пойди, поставь сторожа») мог быть причастен Трумен Капоте, но финальный текст, вероятно, принадлежит Харпер Ли. Результаты подтверждены на основе параметрического критерия Пирсона, а также непараметрических U-критерия Манна - Уитни и критерия Крускала - Уоллиса.
Переведенное названиеA novel method of stylometry based on the statistic of numerals
Язык оригиналаРусский
Страницы (с-по)837-850
Число страниц14
ЖурналComputer Research and Modeling
Том9
Номер выпуска5
DOI
СостояниеОпубликовано - 1 янв. 2017

    Уровень публикации

  • Перечень ВАК

    Предметные области ASJC Scopus

  • Computer Science Applications
  • Computational Theory and Mathematics
  • Modelling and Simulation

    ГРНТИ

  • 27.43.00 Теория вероятностей и математическая статистика

ID: 7018732