Мультимодальное распознавание эмоций

Раздел
Программирование
Просмотров
65
Покупок
0
Антиплагиат
Не указан
Размещена
3 Апр в 09:20
ВУЗ
2025
Курс
Не указан
Стоимость
2 700 ₽
Файлы работы   
1
Каждая работа проверяется на плагиат, на момент публикации уникальность составляет не менее 40% по системе проверки eTXT.
pdf
вкр
1.8 Мбайт
Описание

Работа посвящена разработке системы мультимодального распознавания эмоций на основе видео- и аудиопотоков. В основе лежит модульная архитектура с независимой обработкой визуальной, аудио- и текстовой информации и последующим объединением результатов. Для каждой модальности применяются специализированные нейросетевые модели: ResNet для лица, wav2vec 2.0 [22] и спектрограммы для звука, RoBERTa — для текста.

Задачи, решаемые в ходе исследования:

1.Анализ существующих методов распознавания эмоций.

2.Проектирование модульной архитектуры.

3.Реализация и обучение отдельных моделей.

4.Разработка алгоритма объединения результатов.

5.Тестирование и оценка качества системы.

Работа выполнена на базе СПбПУ. Использовались открытые датасеты (FER2013, AffectNet, IEMOCAP, RAVDESS), фреймворки PyTorch и Hugging Face, библиотеки обработки медиа (Librosa, OpenCV, Whisper). Система протестирована на мультимодальных данных и показала устойчивость при неполных входных потоках.

По итогам предложены рекомендации по дальнейшему развитию: добавление анализа жестов и микроэмоций, прогнозирование изменений эмоционального состояния.

Использованные информационные технологии: Python, PyTorch, Hugging Face Transformers, Librosa, OpenCV, Google Colab, Docker, Git/GitHub, SQLite.

Оглавление

СОДЕРЖАНИЕ

ГЛАВА 1. ВВЕДЕНИЕ ........................................................................................... 5

ГЛАВА 2. ТЕОРЕТИЧЕСКОЕ ОБОСНОВАНИЕ ................................................ 7

2.1. Проблематика и актуальность ............................................................. 7

2.2. Обзор существующих решений ........................................................... 8

2.2.1. Мультимодальные подходы ......................................................... 8

2.2.2. Визуальная модальность ............................................................ 10

2.2.3. Аудио модальность ..................................................................... 12

2.2.4. Текстовая модальность ............................................................... 13

ГЛАВА 3. АРХИТЕКТУРА СИСТЕМЫ ............................................................. 15

3.1. Общая идея и мотивация модульного подхода ................................ 15

3.2. Структура системы ............................................................................. 15

3.3. Принцип обработки модальностей ................................................... 17

3.3.1. Обработка видео: этап выделения и проверки аудио .............. 17

3.3.2. Работа аудио модуля AED .......................................................... 17

3.3.3. Распознавание речи с помощью Whisper ................................. 22

3.3.4. Анализ текста с помощью эмбеддингов ................................... 24

3.3.5. Реализация визуальной модальности ....................................... 26

3.4. Модульность и возможности для доработки .................................... 29

ГЛАВА 4. ИСПОЛЬЗОВАННЫЕ ДАТАСЕТЫ .................................................. 31

4.1. Визуальная модальность .................................................................... 31

4.2. Аудио модальность ............................................................................. 31

4.3. Текстовая модальность ....................................................................... 32

ГЛАВА 5. ЭКСПЕРЕМЕНТАЛЬНАЯ ОЦЕНКА ............................................... 33

5.1. Анализ фрагмента из «1+1» (театр) .................................................. 33

5.2. Анализ видео без аудио ...................................................................... 35

5.3. Анализ фрагмента из «1+1» (проблема в отношениях) .................. 37

ЗАКЛЮЧЕНИЕ ..................................................................................................... 39

СПИСОК ИСПОЛЬЗОВАННЫХ ИСТОЧНИКОВ ............................................ 40

ПРИЛОЖЕНИЕ 1 .................................................................................................. 42

Список литературы

СПИСОК ИСПОЛЬЗОВАННЫХ ИСТОЧНИКОВ

1.Dakkusingh. Microsoft Azure Emotion API unofficial interface [Электронный ресурс]. — GitHub. URL:

2.Kaggle. CREMA-D: Crowd-sourced Emotional Multimodal Actors Dataset [Электронный ресурс]. — URL:

3.Kaggle. RAF-DB Dataset [Электронный ресурс]. — URL:

4.Papers With Code. BiLSTM [Электронный ресурс]. — URL:

5.Papers With Code. RAVDESS Dataset [Электронный ресурс]. — URL:

6.Qiuqiangkong. AudioSet Tagging CNN [Электронный ресурс]. — GitHub. URL:

7.Radford A., Kim J. W., Hallacy C., et al. Robust Speech Recognition via Large-Scale Weak Supervision [Электронный ресурс] //

8.Schluter J., Grill T. Exploring Data Augmentation for Improved Singing Voice Detection with Neural Networks [Электронный ресурс] // DAFx. — 2015. URL:

всего 24 источника

Вам подходит эта работа?
Похожие работы
Другие работы автора
Прямой эфир