ПОЛНОЕ ЗАДАНИЕ В ДЕМО ФАЙЛЕ
+ ДЛЯ ПОИСКА ДУБЛИРУЮ НИЖЕ
Практические задания:
1. Развертывание базы данных и SQL-моделирование.
Задача. Развернуть PostgreSQL в Docker-контейнере. Спроектировать и реализовать физическую модель данных (схема «Звезда») для dataset "Superstore". Загрузить сырые данные.
Результат. SQL-скрипты (DDL, INSERT), скриншот успешных запросов к таблицам фактов и измерений.
2. Построение DWH с использованием dbt (Data Build Tool).
Задача. Развернуть dbt-проект поверх PostgreSQL. Реализовать многоуровневую архитектуру (Staging -> Intermediate -> Marts). Создать витрину данных для анализа "спящих ценных клиентов" (mart_valuable_dormant_customers). Написать тесты качества данных.
Результат. Ссылка на репозиторий с кодом моделей, скриншот графа зависимостей (Lineage) и успешного прохождения тестов (dbt test).
3. Оркестрация процессов с Apache Airflow.
Задача. Написать DAG на Python для Apache Airflow (развернутого локально в Docker), который автоматизирует запуск dbt-моделей. DAG должен включать шаги: запуск моделей (dbt run) и тестирование (dbt test).
Результат. Файл dag.py, скриншот Airflow UI с успешным выполнением графа (все задачи зеленые).
4. Анализ продаж интернет-магазина электроники
Проведите комплексный анализ данных о продажах смартфонов: работа с БД (SQL-запросы, JOIN), исследовательский анализ (EDA), анализ временных рядов и построение модели прогнозирования месячных продаж.
База данных: electronics_shop.db
Шаблон задания: https://github.com/BosenkoTM/Python_for_scientists/blob/main/examp/mod_examp_Python_for_scientists/variant_01.ipynb
5. Дискретно-событийное моделирование. Системы массового обслуживания
Нарисуйте структурную схему модели в формате блоков AnyLogic (Source, Queue, selectOutput, Service, ResourcePool, Sink и др.) для дискретно-событийной модели с двумя основными и одной резервной кассами. Опишите логику ухода клиентов, если их время ожидания превышает заданные пороги.
6. Дискретно-событийное моделирование. Производственные системы и потоки.
Нарисуйте концептуальную схему моделирования процесса производства мороженого, состоящего из следующих элементов: потоков молока, сахара и масла, смесителя, реактора заморозки, конвейеров, участков порционирования и упаковки. Для каждого этапа подпишите, какими объектами AnyLogic он реализуется (FluidSource, Tank, Pipeline, BulkConveyor, MixTank, ProcessTank, FluidToAgent, Source, Queue, Assembler, Conveyor, Service, Batch, Sink и т.п.).
Отметьте места, где происходит изменение свойств партии (смена типа потока/агента, смена цвета на анимации и др.).
7. Анализ кредитного портфеля банка
Проведите анализ кредитного портфеля и разработайте модель оценки кредитного риска: работа с БД, EDA, анализ временных рядов выдачи кредитов, построение модели классификации для прогнозирования дефолтов.
База данных: bank_loans.db
Шаблон задания:
8. По индивидуальным данным (файл с https://www.kaggle.com/datasets) постройте модель классификации с помощью алгоритмов линейной регрессии, случайного леса и градиентного бустинга, интерпретируйте полученные результаты, оцените важность признаков. Задачу решить в среде Google Colab.
9. Анализ доставки сети ресторанов
Проанализируйте данные о заказах сети ресторанов с доставкой: работа с БД, EDA с проверкой гипотез, анализ временных рядов выручки, построение модели прогнозирования недельной выручки для планирования закупок.
Базаданных: restaurant_delivery.db
Шаблонзадания:
10. HR-аналитика: текучесть кадров в IT-компании
Проведите анализ данных о сотрудниках IT-компании: работа с БД, EDA для выявления факторов текучести, анализ временных рядов найма, построение модели классификации для прогнозирования оттока сотрудников.
База данных: hr_analytics.db
Шаблон задания:
11. По индивидуальным данным (файл с https://www.kaggle.com/datasets) постройте модель классификациис помощью алгоритмов линейной регрессии, случайного леса и градиентного бустинга, интерпретируйте полученные результаты, оцените важность признаков. Задачу решить в среде Google Colab.
12. По индивидуальным данным (файл с https://www.kaggle.com/datasets) обучить и сравнивать в Google Colab разработать сценарий регрессионного анализа с помощью алгоритмов линейной регрессии, случайного леса и градиентного бустинга, интерпретируйте полученные результаты, оцените важность признаков.
13. По индивидуальным данным (файл с https://www.kaggle.com/datasets) постройте модель классификации с помощью алгоритмов линейной регрессии, случайного леса и градиентного бустинга, интерпретируйте полученные результаты, оцените важность признаков. Задачу решить в среде Google Colab.
14. По индивидуальным данным (файл с https://www.kaggle.com/datasets) обучить и сравнивать в Google Colab разработать сценарий регрессионного анализа с помощью алгоритмов линейной регрессии, случайного леса и градиентного бустинга, интерпретируйте полученные результаты, оцените важность признаков.
15. По индивидуальным данным (файл с https://www.kaggle.com/datasets) постройте модель классификации с помощью алгоритмов линейной регрессии, случайного леса и градиентного бустинга, интерпретируйте полученные результаты, оцените важность признаков. Задачу решить в среде Google Colab.
16. По индивидуальным данным (файл с https://www.kaggle.com/datasets) обучить и сравнивать в Google Colab разработать сценарий регрессионного анализа с помощью алгоритмов линейной регрессии, случайного леса и градиентного бустинга, интерпретируйте полученные результаты, оцените важность признаков.
17. Агент-ориентированное моделирование.
Сформулируйте структуру агентной модели доставки мороженого, в т.ч.:
– выделите типы агентов (производство, склад, курьер, заказ, клиент и т.п.) и их ключевые параметры;
– опишите поведение каждого типа (генерация заказов, маршрутизация курьера, обслуживание заказа, возврат на базу и т.д.);
– предложите 2–3 показателя, по которым по результатам имитации можно оценивать качество работы системы доставки (время доставки, число просроченных заказов, загруженность курьеров и др.).