Работа посвящена разработке системы мультимодального распознавания эмоций на основе видео- и аудиопотоков. В основе лежит модульная архитектура с независимой обработкой визуальной, аудио- и текстовой информации и последующим объединением результатов. Для каждой модальности применяются специализированные нейросетевые модели: ResNet для лица, wav2vec 2.0 [22] и спектрограммы для звука, RoBERTa — для текста.
Задачи, решаемые в ходе исследования:
1.Анализ существующих методов распознавания эмоций.
2.Проектирование модульной архитектуры.
3.Реализация и обучение отдельных моделей.
4.Разработка алгоритма объединения результатов.
5.Тестирование и оценка качества системы.
Работа выполнена на базе СПбПУ. Использовались открытые датасеты (FER2013, AffectNet, IEMOCAP, RAVDESS), фреймворки PyTorch и Hugging Face, библиотеки обработки медиа (Librosa, OpenCV, Whisper). Система протестирована на мультимодальных данных и показала устойчивость при неполных входных потоках.
По итогам предложены рекомендации по дальнейшему развитию: добавление анализа жестов и микроэмоций, прогнозирование изменений эмоционального состояния.
Использованные информационные технологии: Python, PyTorch, Hugging Face Transformers, Librosa, OpenCV, Google Colab, Docker, Git/GitHub, SQLite.
СОДЕРЖАНИЕ
ГЛАВА 1. ВВЕДЕНИЕ ........................................................................................... 5
ГЛАВА 2. ТЕОРЕТИЧЕСКОЕ ОБОСНОВАНИЕ ................................................ 7
2.1. Проблематика и актуальность ............................................................. 7
2.2. Обзор существующих решений ........................................................... 8
2.2.1. Мультимодальные подходы ......................................................... 8
2.2.2. Визуальная модальность ............................................................ 10
2.2.3. Аудио модальность ..................................................................... 12
2.2.4. Текстовая модальность ............................................................... 13
ГЛАВА 3. АРХИТЕКТУРА СИСТЕМЫ ............................................................. 15
3.1. Общая идея и мотивация модульного подхода ................................ 15
3.2. Структура системы ............................................................................. 15
3.3. Принцип обработки модальностей ................................................... 17
3.3.1. Обработка видео: этап выделения и проверки аудио .............. 17
3.3.2. Работа аудио модуля AED .......................................................... 17
3.3.3. Распознавание речи с помощью Whisper ................................. 22
3.3.4. Анализ текста с помощью эмбеддингов ................................... 24
3.3.5. Реализация визуальной модальности ....................................... 26
3.4. Модульность и возможности для доработки .................................... 29
ГЛАВА 4. ИСПОЛЬЗОВАННЫЕ ДАТАСЕТЫ .................................................. 31
4.1. Визуальная модальность .................................................................... 31
4.2. Аудио модальность ............................................................................. 31
4.3. Текстовая модальность ....................................................................... 32
ГЛАВА 5. ЭКСПЕРЕМЕНТАЛЬНАЯ ОЦЕНКА ............................................... 33
5.1. Анализ фрагмента из «1+1» (театр) .................................................. 33
5.2. Анализ видео без аудио ...................................................................... 35
5.3. Анализ фрагмента из «1+1» (проблема в отношениях) .................. 37
ЗАКЛЮЧЕНИЕ ..................................................................................................... 39
СПИСОК ИСПОЛЬЗОВАННЫХ ИСТОЧНИКОВ ............................................ 40
ПРИЛОЖЕНИЕ 1 .................................................................................................. 42
СПИСОК ИСПОЛЬЗОВАННЫХ ИСТОЧНИКОВ
1.Dakkusingh. Microsoft Azure Emotion API unofficial interface [Электронный ресурс]. — GitHub. URL:
2.Kaggle. CREMA-D: Crowd-sourced Emotional Multimodal Actors Dataset [Электронный ресурс]. — URL:
3.Kaggle. RAF-DB Dataset [Электронный ресурс]. — URL:
4.Papers With Code. BiLSTM [Электронный ресурс]. — URL:
5.Papers With Code. RAVDESS Dataset [Электронный ресурс]. — URL:
6.Qiuqiangkong. AudioSet Tagging CNN [Электронный ресурс]. — GitHub. URL:
7.Radford A., Kim J. W., Hallacy C., et al. Robust Speech Recognition via Large-Scale Weak Supervision [Электронный ресурс] //
8.Schluter J., Grill T. Exploring Data Augmentation for Improved Singing Voice Detection with Neural Networks [Электронный ресурс] // DAFx. — 2015. URL:
всего 24 источника