НОВЫЙ МЕТОД СТИЛЕМЕТРИИ НА ОСНОВЕ СТАТИСТИКИ ЧИСЛИТЕЛЬНЫХ

Standard

НОВЫЙ МЕТОД СТИЛЕМЕТРИИ НА ОСНОВЕ СТАТИСТИКИ ЧИСЛИТЕЛЬНЫХ. / Zenkov, A. V.
в: Computer Research and Modeling, Том 9, № 5, 01.01.2017, стр. 837-850.

Результаты исследований: Вклад в журнал › Статья › Рецензирование

BibTeX

@article{89960eec485b447eb771df84fc3d420b,

title = "НОВЫЙ МЕТОД СТИЛЕМЕТРИИ НА ОСНОВЕ СТАТИСТИКИ ЧИСЛИТЕЛЬНЫХ",

abstract = "Предложен новый метод статистического анализа текстов. Исследовано распределение частот различных первых значащих цифр в числительных англоязычных текстов. Учитываются количественные и порядковые числительные, выраженные как цифрами, так и словесно. Предварительно из текста удаляются случайно попавшие в него числительные, не отражающие авторский замысел (номера страниц, маркеры списков, идиоматические выражения, устойчивые обороты речи и тому подобное). Обнаружено, что для сборных текстов разного авторства частоты первых значащих цифр приближенно соответствуют известному закону Бенфорда, но с резким преобладанием встречаемости единицы. В связных авторских текстах возникают характерные отклонения от закона Бенфорда; показано, что эти отклонения являются статистически устойчивыми и значимыми авторскими особенностями, позволяющими при определенных условиях ответить на вопрос об авторстве и различить тексты разных авторов. Требуется, чтобы текст был достаточно длинным (не менее чем порядка 200 кБ). Распределение первых значащих цифр конца ряда {1, 2,..., 8, 9} подвержено сильным флуктуациям и не показательно для нашей цели. Цель теоретического обоснования найденной эмпирической закономерности в работе не ставится, но продемонстрировано ее практическое использование для атрибуции текстов. Предлагаемый подход и сделанные выводы подкреплены примерами компьютерного анализа художественных текстов У. М. Теккерея, М. Твена,Р. Л. Стивенсона, Дж. Джойса, сестер Бронте, Дж. Остин. На основе разработанной методологии рассмотрены проблемы авторства текста, ранее приписывавшегося Л. Ф. Бауму (результат согласуется с полученным другими методами), а также известного романа Харпер Ли «Убить пересмешника»; показано, что к написанию первоначального варианта этой книги («Пойди, поставь сторожа») мог быть причастен Трумен Капоте, но финальный текст, вероятно, принадлежит Харпер Ли. Результаты подтверждены на основе параметрического критерия Пирсона, а также непараметрических U-критерия Манна - Уитни и критерия Крускала - Уоллиса.",

keywords = "First significant digit of numerals, Text attribution",

author = "Zenkov, {A. V.}",

year = "2017",

month = jan,

day = "1",

doi = "10.20537/2076-7633-2017-9-5-837-850",

language = "Русский",

volume = "9",

pages = "837--850",

journal = "Computer Research and Modeling",

issn = "2076-7633",

publisher = "Institute of Computer Science Izhevsk",

number = "5",

}

RIS

TY - JOUR

T1 - НОВЫЙ МЕТОД СТИЛЕМЕТРИИ НА ОСНОВЕ СТАТИСТИКИ ЧИСЛИТЕЛЬНЫХ

AU - Zenkov, A. V.

PY - 2017/1/1

Y1 - 2017/1/1

N2 - Предложен новый метод статистического анализа текстов. Исследовано распределение частот различных первых значащих цифр в числительных англоязычных текстов. Учитываются количественные и порядковые числительные, выраженные как цифрами, так и словесно. Предварительно из текста удаляются случайно попавшие в него числительные, не отражающие авторский замысел (номера страниц, маркеры списков, идиоматические выражения, устойчивые обороты речи и тому подобное). Обнаружено, что для сборных текстов разного авторства частоты первых значащих цифр приближенно соответствуют известному закону Бенфорда, но с резким преобладанием встречаемости единицы. В связных авторских текстах возникают характерные отклонения от закона Бенфорда; показано, что эти отклонения являются статистически устойчивыми и значимыми авторскими особенностями, позволяющими при определенных условиях ответить на вопрос об авторстве и различить тексты разных авторов. Требуется, чтобы текст был достаточно длинным (не менее чем порядка 200 кБ). Распределение первых значащих цифр конца ряда {1, 2,..., 8, 9} подвержено сильным флуктуациям и не показательно для нашей цели. Цель теоретического обоснования найденной эмпирической закономерности в работе не ставится, но продемонстрировано ее практическое использование для атрибуции текстов. Предлагаемый подход и сделанные выводы подкреплены примерами компьютерного анализа художественных текстов У. М. Теккерея, М. Твена,Р. Л. Стивенсона, Дж. Джойса, сестер Бронте, Дж. Остин. На основе разработанной методологии рассмотрены проблемы авторства текста, ранее приписывавшегося Л. Ф. Бауму (результат согласуется с полученным другими методами), а также известного романа Харпер Ли «Убить пересмешника»; показано, что к написанию первоначального варианта этой книги («Пойди, поставь сторожа») мог быть причастен Трумен Капоте, но финальный текст, вероятно, принадлежит Харпер Ли. Результаты подтверждены на основе параметрического критерия Пирсона, а также непараметрических U-критерия Манна - Уитни и критерия Крускала - Уоллиса.

AB - Предложен новый метод статистического анализа текстов. Исследовано распределение частот различных первых значащих цифр в числительных англоязычных текстов. Учитываются количественные и порядковые числительные, выраженные как цифрами, так и словесно. Предварительно из текста удаляются случайно попавшие в него числительные, не отражающие авторский замысел (номера страниц, маркеры списков, идиоматические выражения, устойчивые обороты речи и тому подобное). Обнаружено, что для сборных текстов разного авторства частоты первых значащих цифр приближенно соответствуют известному закону Бенфорда, но с резким преобладанием встречаемости единицы. В связных авторских текстах возникают характерные отклонения от закона Бенфорда; показано, что эти отклонения являются статистически устойчивыми и значимыми авторскими особенностями, позволяющими при определенных условиях ответить на вопрос об авторстве и различить тексты разных авторов. Требуется, чтобы текст был достаточно длинным (не менее чем порядка 200 кБ). Распределение первых значащих цифр конца ряда {1, 2,..., 8, 9} подвержено сильным флуктуациям и не показательно для нашей цели. Цель теоретического обоснования найденной эмпирической закономерности в работе не ставится, но продемонстрировано ее практическое использование для атрибуции текстов. Предлагаемый подход и сделанные выводы подкреплены примерами компьютерного анализа художественных текстов У. М. Теккерея, М. Твена,Р. Л. Стивенсона, Дж. Джойса, сестер Бронте, Дж. Остин. На основе разработанной методологии рассмотрены проблемы авторства текста, ранее приписывавшегося Л. Ф. Бауму (результат согласуется с полученным другими методами), а также известного романа Харпер Ли «Убить пересмешника»; показано, что к написанию первоначального варианта этой книги («Пойди, поставь сторожа») мог быть причастен Трумен Капоте, но финальный текст, вероятно, принадлежит Харпер Ли. Результаты подтверждены на основе параметрического критерия Пирсона, а также непараметрических U-критерия Манна - Уитни и критерия Крускала - Уоллиса.

KW - First significant digit of numerals

KW - Text attribution

UR - http://www.scopus.com/inward/record.url?scp=85044141384&partnerID=8YFLogxK

UR - https://elibrary.ru/item.asp?id=30604788

U2 - 10.20537/2076-7633-2017-9-5-837-850

DO - 10.20537/2076-7633-2017-9-5-837-850

M3 - Статья

AN - SCOPUS:85044141384

VL - 9

SP - 837

EP - 850

JO - Computer Research and Modeling

JF - Computer Research and Modeling

SN - 2076-7633

IS - 5

ER -

ID: 7018732