Раздел
Программирование
Просмотров
2
Покупок
0
Антиплагиат
Не указан
Размещена
12 Авг в 12:39
ВУЗ
Не указан
Курс
Не указан
Стоимость
2 450 ₽
Демо-файлы   
1
docx
prakticheskaya-chast
19.4 Кбайт
Файлы работы   
1
Каждая работа проверяется на плагиат, на момент публикации уникальность составляет не менее 40% по системе проверки eTXT.
docx
ПРАКТИЧЕСКАЯ ЧАСТЬ
71.9 Кбайт
Описание

ПОЛНОЕ ЗАДАНИЕ В ДЕМО ФАЙЛЕ

+ ДЛЯ ПОИСКА ДУБЛИРУЮ НИЖЕ

Оглавление

Практические задания:

1.        Развертывание базы данных и SQL-моделирование.

Задача. Развернуть PostgreSQL в Docker-контейнере. Спроектировать и реализовать физическую модель данных (схема «Звезда») для dataset "Superstore". Загрузить сырые данные.

Результат. SQL-скрипты (DDL, INSERT), скриншот успешных запросов к таблицам фактов и измерений.

2.        Построение DWH с использованием dbt (Data Build Tool).

Задача. Развернуть dbt-проект поверх PostgreSQL. Реализовать многоуровневую архитектуру (Staging -> Intermediate -> Marts). Создать витрину данных для анализа "спящих ценных клиентов" (mart_valuable_dormant_customers). Написать тесты качества данных.

Результат. Ссылка на репозиторий с кодом моделей, скриншот графа зависимостей (Lineage) и успешного прохождения тестов (dbt test).

3.        Оркестрация процессов с Apache Airflow.

Задача. Написать DAG на Python для Apache Airflow (развернутого локально в Docker), который автоматизирует запуск dbt-моделей. DAG должен включать шаги: запуск моделей (dbt run) и тестирование (dbt test).

Результат. Файл dag.py, скриншот Airflow UI с успешным выполнением графа (все задачи зеленые).

4.        Анализ продаж интернет-магазина электроники

Проведите комплексный анализ данных о продажах смартфонов: работа с БД (SQL-запросы, JOIN), исследовательский анализ (EDA), анализ временных рядов и построение модели прогнозирования месячных продаж.

База данных: electronics_shop.db

Шаблон задания: https://github.com/BosenkoTM/Python_for_scientists/blob/main/examp/mod_examp_Python_for_scientists/variant_01.ipynb

5.        Дискретно-событийное моделирование. Системы массового обслуживания

Нарисуйте структурную схему модели в формате блоков AnyLogic (Source, Queue, selectOutput, Service, ResourcePool, Sink и др.) для дискретно-событийной модели с двумя основными и одной резервной кассами. Опишите логику ухода клиентов, если их время ожидания превышает заданные пороги.

6.        Дискретно-событийное моделирование. Производственные системы и потоки.

Нарисуйте концептуальную схему моделирования процесса производства мороженого, состоящего из следующих элементов: потоков молока, сахара и масла, смесителя, реактора заморозки, конвейеров, участков порционирования и упаковки. Для каждого этапа подпишите, какими объектами AnyLogic он реализуется (FluidSource, Tank, Pipeline, BulkConveyor, MixTank, ProcessTank, FluidToAgent, Source, Queue, Assembler, Conveyor, Service, Batch, Sink и т.п.).

Отметьте места, где происходит изменение свойств партии (смена типа потока/агента, смена цвета на анимации и др.).

7.        Анализ кредитного портфеля банка

Проведите анализ кредитного портфеля и разработайте модель оценки кредитного риска: работа с БД, EDA, анализ временных рядов выдачи кредитов, построение модели классификации для прогнозирования дефолтов.

База данных: bank_loans.db

Шаблон задания:

https://github.com/BosenkoTM/Python_for_scientists/blob/main/examp/mod_examp_Python_for_scientists/variant_02.ipynb

8.        По индивидуальным данным (файл с https://www.kaggle.com/datasets) постройте модель классификации с помощью алгоритмов линейной регрессии, случайного леса и градиентного бустинга, интерпретируйте полученные результаты, оцените важность признаков. Задачу решить в среде Google Colab.

9.        Анализ доставки сети ресторанов

Проанализируйте данные о заказах сети ресторанов с доставкой: работа с БД, EDA с проверкой гипотез, анализ временных рядов выручки, построение модели прогнозирования недельной выручки для планирования закупок.

Базаданных: restaurant_delivery.db

Шаблонзадания:

https://github.com/BosenkoTM/Python_for_scientists/blob/main/examp/mod_examp_Python_for_scientists/variant_03.ipynb

10.    HR-аналитика: текучесть кадров в IT-компании

Проведите анализ данных о сотрудниках IT-компании: работа с БД, EDA для выявления факторов текучести, анализ временных рядов найма, построение модели классификации для прогнозирования оттока сотрудников.

База данных: hr_analytics.db

Шаблон задания:

https://github.com/BosenkoTM/Python_for_scientists/blob/main/examp/mod_examp_Python_for_scientists/variant_04.ipynb

11.    По индивидуальным данным (файл с https://www.kaggle.com/datasets) постройте модель классификациис помощью алгоритмов линейной регрессии, случайного леса и градиентного бустинга, интерпретируйте полученные результаты, оцените важность признаков. Задачу решить в среде Google Colab.

12.    По индивидуальным данным (файл с https://www.kaggle.com/datasets) обучить и сравнивать в Google Colab разработать сценарий регрессионного анализа с помощью алгоритмов линейной регрессии, случайного леса и градиентного бустинга, интерпретируйте полученные результаты, оцените важность признаков.

13.    По индивидуальным данным (файл с https://www.kaggle.com/datasets) постройте модель классификации с помощью алгоритмов линейной регрессии, случайного леса и градиентного бустинга, интерпретируйте полученные результаты, оцените важность признаков. Задачу решить в среде Google Colab.

14.    По индивидуальным данным (файл с https://www.kaggle.com/datasets) обучить и сравнивать в Google Colab разработать сценарий регрессионного анализа с помощью алгоритмов линейной регрессии, случайного леса и градиентного бустинга, интерпретируйте полученные результаты, оцените важность признаков.

15.    По индивидуальным данным (файл с https://www.kaggle.com/datasets) постройте модель классификации с помощью алгоритмов линейной регрессии, случайного леса и градиентного бустинга, интерпретируйте полученные результаты, оцените важность признаков. Задачу решить в среде Google Colab.

16.    По индивидуальным данным (файл с https://www.kaggle.com/datasets) обучить и сравнивать в Google Colab разработать сценарий регрессионного анализа с помощью алгоритмов линейной регрессии, случайного леса и градиентного бустинга, интерпретируйте полученные результаты, оцените важность признаков.

17.    Агент-ориентированное моделирование.

Сформулируйте структуру агентной модели доставки мороженого, в т.ч.:

– выделите типы агентов (производство, склад, курьер, заказ, клиент и т.п.) и их ключевые параметры;

– опишите поведение каждого типа (генерация заказов, маршрутизация курьера, обслуживание заказа, возврат на базу и т.д.);

– предложите 2–3 показателя, по которым по результатам имитации можно оценивать качество работы системы доставки (время доставки, число просроченных заказов, загруженность курьеров и др.).

Вам подходит эта работа?
Похожие работы
Другие работы автора
Прямой эфир