АВТОМАТИЧЕСКОЕ ОПРЕДЕЛЕНИЕ ТЕМ, АССОЦИИРОВАННЫХ С ПАНДЕМИЕЙ COVID-19, В РУССКОЯЗЫЧНОМ КОРПУСЕ СОЦИАЛЬНЫХ МЕДИА
|
Введение 3
Глава 1. Тематическое моделирование: основные понятия и алгоритмы 6
1.1 Введение в тематическое моделирование 6
1.2 Задачи и основные алгоритмы тематического моделирования 7
1.3 Обзор алгоритмов BERT и LDA
1.4 Sentence-BERT
1.5 Векторы слов
1.6 TF-IDF
1.7 Оценивание качества тематических моделей 18
Глава 2. Эксперимент по построению тематической модели корпуса сообщений пользователей сети Twitter 23
2.1 Выбор источника и сбор данных 23
2.2 Предварительная обработка корпуса 24
2.3 Построение тематической модели корпуса
2.4 Анализ результатов эксперимента 28
Заключение
Список литературы 36
Приложение
Глава 1. Тематическое моделирование: основные понятия и алгоритмы 6
1.1 Введение в тематическое моделирование 6
1.2 Задачи и основные алгоритмы тематического моделирования 7
1.3 Обзор алгоритмов BERT и LDA
1.4 Sentence-BERT
1.5 Векторы слов
1.6 TF-IDF
1.7 Оценивание качества тематических моделей 18
Глава 2. Эксперимент по построению тематической модели корпуса сообщений пользователей сети Twitter 23
2.1 Выбор источника и сбор данных 23
2.2 Предварительная обработка корпуса 24
2.3 Построение тематической модели корпуса
2.4 Анализ результатов эксперимента 28
Заключение
Список литературы 36
Приложение
Построение тематической модели корпуса текстов - это задача, относящаяся к области извлечения информации. Это процесс извлечения наборов слов (тем) из набора документов, которые наилучшим образом отражают существующую в данном наборе документов информацию. Тематическое моделирование включает в себя методы, с помощью которых можно оптимизировать работу с большим количеством текстовой информации.
Поскольку тематическое моделирование - многофункциональный, развивающийся метод, в настоящее время он используется во многих областях: от обработки естественного языка до научной литературы, программной инженерии, биоинформатики, гуманитарных наук и так далее. Тематическое моделирование находит широкое применение в решении задач информационного поиска, автоматического аннотирования и индексирования документов, выявления паттернов поведения, обнаружения и отслеживания событий в новостных потоках, построения профилей интересов пользователей в рекомендательных системах и т.д.
В настоящее время значительная часть населения Российской Федерации (48%), согласно исследованию Digital 2020 Global Overview Report [15], использует те или иные социальные сети. Одним из направлений обработки естественного языка является исследование социальных сетей и тематическое моделирование на материале постов пользователей той или иной социальной сети. Актуальность данного исследования определяется значимостью анализа изменения наиболее распространённых тем среди пользователей для различных областей, таких как маркетинг, безопасность, образование, менеджмент и т.д. Результат подобного анализа может помогать задавать вектор развития определенной области, выявляя ключевые и актуальные для пользователей темы.
В данной работе сделан акцент на исследование подтем в рамках темы COVID-19, так как в условиях пандемии активное обсуждение в социальных сетях различных сфер жизни общества даст наиболее показательные результаты использования методов тематического моделирования в определении тем и сопоставлении тематического состава постов пользователей за определенный промежуток времени. В нашем исследовании применяется два подхода к построению тематической модели на основе одного корпуса постов из социальных сетей: латентное размещение Дирихле LDA (Latent Dirichlet Allocation) и двунаправленная мультиязычная модель BERT, а также производится анализ и сравнение полученных результатов.
Целью данной работы является автоматическое исследование тематики сообщений в социальной сети Twitter в заданных хронологических рамках с помощью алгоритмов тематического моделирования.
Для достижения поставленной цели необходимо решить следующий ряд задач:
1) изучение существующих алгоритмов тематического моделирования;
a. обзор анализ хода развития технологии тематического моделирования
b. исследование существующих методов и алгоритмов тематического моделирования
2) выбор источника данных;
3) сбор данных с помощью интерфейсов API Twitter и библиотеки Tweepy для языка программирования Python;
4) предварительная обработка данных;
5) построение тематической модели LDA;
6) построение тематической модели с использованием алгоритмов LDA и BERT;
7) оценка полученных результатов с помощью выбранных методов оценивания качества тематических моделей
8) сравнение результатов экспериментов
В качестве материала исследования была выбрана социальная сеть Twitter. Данная социальная сеть была выбрана в связи с наличием доступного интерфейса API и необходимых для данного исследования параметров для сбора данных, таких как объём постов, язык, страна публикации, временной диапазон и наличие в посте ключевых слов (“коронавирус”, “пандемия”, “covid’’, “ковид”, “корона”), материалом исследования послужил корпус русскоязычных сообщений из социальной сети Twitter на тему COVID-19 за период с 03.2020 по 03.2021. Twitter остается самой “высокой” из всех соцсетей – в среднем на каждого автора приходится 47,1 сообщений в месяц.
В качестве основного инструментария для тематического моделирования в данной работе выбран алгоритм тематического моделирования LDA и нейронная сеть BERT, использование которой должно исключить влияние вышеперечисленных факторов на конечный результат.
Теоретическая значимость исследования заключается в разработке гибридной тематической модели корпуса текстов, совмещающей в себе вероятностную тематическую модель и модель распределенных векторов.
Практическая применимость результатов исследования заключается в описании тематической структуры узкоспециализированного русскоязычного корпуса, а именно, корпуса твитов, содержание которых ассоциировано с СOVID-19. Данное исследование может быть использовано социологами и психологами в мониторинге новостных сообщений и социальных сетей.
В настоящее время отсутствуют работы на предмет исследования русскоязычных сообщений пользователей в социальных сетях на основании модели BERT+LDA. Этот факт подтверждает новизну выпускной квалификационной работы.
Поскольку тематическое моделирование - многофункциональный, развивающийся метод, в настоящее время он используется во многих областях: от обработки естественного языка до научной литературы, программной инженерии, биоинформатики, гуманитарных наук и так далее. Тематическое моделирование находит широкое применение в решении задач информационного поиска, автоматического аннотирования и индексирования документов, выявления паттернов поведения, обнаружения и отслеживания событий в новостных потоках, построения профилей интересов пользователей в рекомендательных системах и т.д.
В настоящее время значительная часть населения Российской Федерации (48%), согласно исследованию Digital 2020 Global Overview Report [15], использует те или иные социальные сети. Одним из направлений обработки естественного языка является исследование социальных сетей и тематическое моделирование на материале постов пользователей той или иной социальной сети. Актуальность данного исследования определяется значимостью анализа изменения наиболее распространённых тем среди пользователей для различных областей, таких как маркетинг, безопасность, образование, менеджмент и т.д. Результат подобного анализа может помогать задавать вектор развития определенной области, выявляя ключевые и актуальные для пользователей темы.
В данной работе сделан акцент на исследование подтем в рамках темы COVID-19, так как в условиях пандемии активное обсуждение в социальных сетях различных сфер жизни общества даст наиболее показательные результаты использования методов тематического моделирования в определении тем и сопоставлении тематического состава постов пользователей за определенный промежуток времени. В нашем исследовании применяется два подхода к построению тематической модели на основе одного корпуса постов из социальных сетей: латентное размещение Дирихле LDA (Latent Dirichlet Allocation) и двунаправленная мультиязычная модель BERT, а также производится анализ и сравнение полученных результатов.
Целью данной работы является автоматическое исследование тематики сообщений в социальной сети Twitter в заданных хронологических рамках с помощью алгоритмов тематического моделирования.
Для достижения поставленной цели необходимо решить следующий ряд задач:
1) изучение существующих алгоритмов тематического моделирования;
a. обзор анализ хода развития технологии тематического моделирования
b. исследование существующих методов и алгоритмов тематического моделирования
2) выбор источника данных;
3) сбор данных с помощью интерфейсов API Twitter и библиотеки Tweepy для языка программирования Python;
4) предварительная обработка данных;
5) построение тематической модели LDA;
6) построение тематической модели с использованием алгоритмов LDA и BERT;
7) оценка полученных результатов с помощью выбранных методов оценивания качества тематических моделей
8) сравнение результатов экспериментов
В качестве материала исследования была выбрана социальная сеть Twitter. Данная социальная сеть была выбрана в связи с наличием доступного интерфейса API и необходимых для данного исследования параметров для сбора данных, таких как объём постов, язык, страна публикации, временной диапазон и наличие в посте ключевых слов (“коронавирус”, “пандемия”, “covid’’, “ковид”, “корона”), материалом исследования послужил корпус русскоязычных сообщений из социальной сети Twitter на тему COVID-19 за период с 03.2020 по 03.2021. Twitter остается самой “высокой” из всех соцсетей – в среднем на каждого автора приходится 47,1 сообщений в месяц.
В качестве основного инструментария для тематического моделирования в данной работе выбран алгоритм тематического моделирования LDA и нейронная сеть BERT, использование которой должно исключить влияние вышеперечисленных факторов на конечный результат.
Теоретическая значимость исследования заключается в разработке гибридной тематической модели корпуса текстов, совмещающей в себе вероятностную тематическую модель и модель распределенных векторов.
Практическая применимость результатов исследования заключается в описании тематической структуры узкоспециализированного русскоязычного корпуса, а именно, корпуса твитов, содержание которых ассоциировано с СOVID-19. Данное исследование может быть использовано социологами и психологами в мониторинге новостных сообщений и социальных сетей.
В настоящее время отсутствуют работы на предмет исследования русскоязычных сообщений пользователей в социальных сетях на основании модели BERT+LDA. Этот факт подтверждает новизну выпускной квалификационной работы.
Данное исследование показывает возможные варианты использования алгоритмов тематического моделирования с помощью алгоритма LDA и дополнительно полученных векторов с помощью модели BERT, обученной для русского языка на корпусе русскоязычных сообщений из социальной сети Twitter.
Было проведено два эксперимента по построению тематической модели:
1. Построение модели с помощью алгоритма LDA. Для улучшения базового алгоритма была проведена дополнительная фильтрация корпуса, эксперименты по подбору оптимального количества тем и предварительное обучение модели на собранном корпусе;
2. Построение тематической модели с конкатенированными векторами, полученными с помощью алгоритма LDA для информации о вероятностном распределении и векторами, полученными с помощью модели BERT для русского языка для информации о контексте слов и их распределении в документах.
Результат экспериментов оценивался с помощью метрик когерентности для оценки качеств полученных тем и silhouette score для оценки качества полученных кластеров.
Алгоритм LDA показал относительно низкие результаты, даже при дополнительных настройках. При максимальных значениях метрик 1, в данной работе этот результат не был достигнут. Мы получили интерпретируемые темы, отражающие некоторые из происходящих событий, но, рассматривая результаты кластеризации, информация из многих сообщений была извлечена неверно/не была учтена в исследовании. По самой распространенной теме в корпусе (“Ежедневные новостные сводки по заболевшим на территории России/Санкт-Петербурга/Европы”) можно сделать вывод о том, что большая часть сообщений, обработанных алгоритмом - посты новостных ресурсов, не содержащие шум в виде неформальной/разговорной лексики/опечатки.
Второй эксперимент показал более высокие результаты, что доказывает, что гипотеза о том, что дополнительная информация о контексте слова, а именно дополнительно полученные векторы предложений, а не слов, помогает улучшить качество тематической модели и дает более интерпретируемые результаты и, следовательно, на выходе дает более качественные кластеры, о чём свидетельствуют увеличившиеся значения метрик качества.
Мы получили большее количество тем, что говорит о том, что модель справилась с обработкой тех документов, которые в первом эксперименте, либо относились к шуму, либо были ошибочно отнесены к тем или иным кластерам.
Самая распространенная из тем, согласно результатам кластеризации, также относится к новостным сводкам, что свидетельствует о снижении популярности социальной сети Twitter среди пользователей на территории РФ, так как большая часть сообщений в настоящее время производится СМИ и аккаунтами тех или иный организаций, предоставляющих информацию о COVID-19. Несмотря на то, что оба алгоритма хорошо справились с выделением этих тем, в перспективе можно отказаться от исследования тем, произведенных подобными аккаунтами и сделать уклон в сторону исследования сообщений пользовательских аккаунтов, включающего также анализ тональности.
Для улучшения результатов в будущих исследованиях необходимо предпринять следующие шаги:
1. Совершенствование и расширение словаря стоп-слов. Сортировка и отбор наиболее частотных прилагательных/глаголов, слов разговорного стиля, опечаток, сдвоенных слов, лемм. Выделение биграмм/триграмм. Несмотря на фильтрацию с помощью расширенного списка стоп-слов и TF-IDF, в числе самых частотных слов полученных тем присутствует шум в виде вышеперечисленных токенов.
2. Фильтрация сообщений на языках, не используемых в качестве объекта исследования. Библиотека Tweepy учитывает выбор языка при поиске и загрузке постов пользователей, однако, с учётом того, что все сообщения на монгольском языке написаны некоторыми пользователями на кириллице, они попадают в категорию русского языка.
3. Сбор корпуса большего размера с захватом более широкого временного промежутка. Это может повлиять на количество обсуждаемых тем/событий и дополнить уже существующие кластеры тем, таким образом, результат получится более репрезентативным. В настоящее время корпус собран в соответствии с наличием вычислительных мощностей.
4. Обучение модели на пользовательском корпусе. В данном эксперименте были использованы векторы из предварительно обученной модели.
5. Настройка оптимальных гиперпараметров/количества кластеров
Было проведено два эксперимента по построению тематической модели:
1. Построение модели с помощью алгоритма LDA. Для улучшения базового алгоритма была проведена дополнительная фильтрация корпуса, эксперименты по подбору оптимального количества тем и предварительное обучение модели на собранном корпусе;
2. Построение тематической модели с конкатенированными векторами, полученными с помощью алгоритма LDA для информации о вероятностном распределении и векторами, полученными с помощью модели BERT для русского языка для информации о контексте слов и их распределении в документах.
Результат экспериментов оценивался с помощью метрик когерентности для оценки качеств полученных тем и silhouette score для оценки качества полученных кластеров.
Алгоритм LDA показал относительно низкие результаты, даже при дополнительных настройках. При максимальных значениях метрик 1, в данной работе этот результат не был достигнут. Мы получили интерпретируемые темы, отражающие некоторые из происходящих событий, но, рассматривая результаты кластеризации, информация из многих сообщений была извлечена неверно/не была учтена в исследовании. По самой распространенной теме в корпусе (“Ежедневные новостные сводки по заболевшим на территории России/Санкт-Петербурга/Европы”) можно сделать вывод о том, что большая часть сообщений, обработанных алгоритмом - посты новостных ресурсов, не содержащие шум в виде неформальной/разговорной лексики/опечатки.
Второй эксперимент показал более высокие результаты, что доказывает, что гипотеза о том, что дополнительная информация о контексте слова, а именно дополнительно полученные векторы предложений, а не слов, помогает улучшить качество тематической модели и дает более интерпретируемые результаты и, следовательно, на выходе дает более качественные кластеры, о чём свидетельствуют увеличившиеся значения метрик качества.
Мы получили большее количество тем, что говорит о том, что модель справилась с обработкой тех документов, которые в первом эксперименте, либо относились к шуму, либо были ошибочно отнесены к тем или иным кластерам.
Самая распространенная из тем, согласно результатам кластеризации, также относится к новостным сводкам, что свидетельствует о снижении популярности социальной сети Twitter среди пользователей на территории РФ, так как большая часть сообщений в настоящее время производится СМИ и аккаунтами тех или иный организаций, предоставляющих информацию о COVID-19. Несмотря на то, что оба алгоритма хорошо справились с выделением этих тем, в перспективе можно отказаться от исследования тем, произведенных подобными аккаунтами и сделать уклон в сторону исследования сообщений пользовательских аккаунтов, включающего также анализ тональности.
Для улучшения результатов в будущих исследованиях необходимо предпринять следующие шаги:
1. Совершенствование и расширение словаря стоп-слов. Сортировка и отбор наиболее частотных прилагательных/глаголов, слов разговорного стиля, опечаток, сдвоенных слов, лемм. Выделение биграмм/триграмм. Несмотря на фильтрацию с помощью расширенного списка стоп-слов и TF-IDF, в числе самых частотных слов полученных тем присутствует шум в виде вышеперечисленных токенов.
2. Фильтрация сообщений на языках, не используемых в качестве объекта исследования. Библиотека Tweepy учитывает выбор языка при поиске и загрузке постов пользователей, однако, с учётом того, что все сообщения на монгольском языке написаны некоторыми пользователями на кириллице, они попадают в категорию русского языка.
3. Сбор корпуса большего размера с захватом более широкого временного промежутка. Это может повлиять на количество обсуждаемых тем/событий и дополнить уже существующие кластеры тем, таким образом, результат получится более репрезентативным. В настоящее время корпус собран в соответствии с наличием вычислительных мощностей.
4. Обучение модели на пользовательском корпусе. В данном эксперименте были использованы векторы из предварительно обученной модели.
5. Настройка оптимальных гиперпараметров/количества кластеров



