1) Реализовать цикл предобработки данных для их последующего интеллектуального анализа или генерации – сбор и предобработку (рекомендуется выбирать общую тематику для всех практик):
– определить предметную область решаемой задачи, для задач последующих практических работ (либо дискриминативной задачи, к которой могут относиться классификация, регрессия, кластеризация и поиск ассоциативных правил, либо генеративной, к которой могут относиться аугментация и генерация табличных данных);
– найти или сгенерировать (на основе некоторого статистического или иного закона) набор данных, содержащий данные для задачи выбранной предметной области (предсказание количества страховых случаев, фильтрация контента, рекомендательные системы и многое другое) в виде табличных данных, соблюдая особенности сбора данных (data collection), в соответствии с чем описать (по возможности) особенности набора данных, достоверность, способы сбора и другие свойства и метрики обеспечения и контроля качества данных в наборе (см. Примечание 1);
– выполнить хотя бы один пункт стека предобработки данных (хотя бы обработку пропущенных значений) в соответствии с определённым качеством данных (см. Примечание 2);
В качестве дополнительного задания реализовать хотя бы один из следующих пунктов (один – на оценку 4, все – на оценку 5):
– выполнить несколько пунктов стека предобработки данных (в том числе в рамках одной задачи, например, обработать часть пропусков их удалением, а часть – заменной статистическими или другими данными);
– выполнить аугментацию данных (см. Примечание 3);
– выполнить визуализацию наборы данных с помощью методов понижения размерности (см. Примечание 4), либо путём выбора основных признаков и вывода попарных (тройных) графиков зависимости (то есть в случае признаков a, b, c, d, e… выводить графики ab, ce, bd и т.п., либо abc, bcd и т.д.).
| Гарантия на работу | 1 год |
| Средний балл | 4.53 |
| Стоимость | Назначаете сами |
| Эксперт | Выбираете сами |
| Уникальность работы | от 70% |