Дайджест докладов с offline-дня SmartData 2022

Дайджест докладов с offline-дня SmartData 2022, image #1

Юлия Волкова

«Любовь и ненависть к Prefect 2.0 после Apache Airflow»

Больше двух лет Юлия работала с Apache Airflow. К дата-инжинирингу она вернулась при разработке Prefect 2.0. Вас ждет предвзятый рассказ о том, как создатели Prefect хотели (или не хотели) сделать лучшую версию Apache Airflow, а создали совсем другой инструмент.

Юлия расскажет, чего не хватает в Prefect, но есть в Apache Airflow, рассмотрит разные парадигмы, стоящие за инструментами. Вы также узнаете, почему нельзя просто взять и переехать с одного инструмента на другой без переосмысления пайплайнов.

Денис Ефаров, Одноклассники

«100 миллиардов сообщений в Kafka: загрузил и забыл»

Apache Kafka — прекрасный инструмент для передачи сообщений между сервисами. Но возможностей Apache Spark не хватило, чтобы выгрузить из него 100 миллиардов сообщений для офлайн-аналитики. Денис расскажет о собственном решении команды, которое позволило выгружать этот объем данных каждый день из Apache Kafka в HDFS без лишних сложностей.

Олег Кочергин, СберЗдоровье

«Ingest-слой платформы данных: смешать, но не взбалтывать»

Вы узнаете о том, как построить Ingest-слой для внутренних и внешних источников — не забывая про работу с чувствительными данными. Олег разберет архитектуру, которую придумала его команда и расскажет про DSL, который управляет всеми компонентами платформы в СберЗдоровье.

Бронислав Житников, Тинькофф

«NIFI-скрипты как элемент Less Code ETL»

В Apache NiFi есть множество трансформаций, которые не требуют кодирования, но они покрывают не все случаи. А разрабатывать процессор на каждую уникальную трансформацию — слишком дорого.

Бронислав Житников расскажет, как с помощью scripting в NiFi можно получить более гибкий инструмент трансформации данных. Вы узнаете, когда следует выбрать скрипт и как это сделать наиболее эффективно. Доклад будет полезен для активных пользователей NiFi, а так же для тех кто рассматривает NiFi в качестве ETL-инструмента для своих задач.

Валерия Дымбицкая, oneFactor

«Автоматический тюнинг Spark-приложений»

Валерия расскажет про систему автоматического тюнинга для Hadoop-кластера, где запускаются сотни ежедневных и тысячи ежечасных Spark-расчетов, каждый со своим SLA.

Из доклада вы узнаете:

— Как извлечь полезную информацию из логов Spark.
— Как подобрать оптимальную память для расчета на основе истории запуска.
— Как автоматизировать процесс и подстраиваться под изменения.
— На что смотреть при автоматическом тюнинге spark.executor.memo

Это далеко не все, что ждет вас 29 октября. В программе также:

— доклады об архитектуре платформ, Big Data, DBMS, Data Governance и MLOps / DevOps;
— интервью со спикерами;
— выступления и стенды с активностями от партнеров конференции.

Полная программа и билеты — на сайте: https://bit.ly/3F5G1ex

24 views·1 share