Дайджест докладов с offline-дня SmartData 2022
Юлия Волкова
«Любовь и ненависть к Prefect 2.0 после Apache Airflow»
Больше двух лет Юлия работала с Apache Airflow. К дата-инжинирингу она вернулась при разработке Prefect 2.0. Вас ждет предвзятый рассказ о том, как создатели Prefect хотели (или не хотели) сделать лучшую версию Apache Airflow, а создали совсем другой инструмент.
Юлия расскажет, чего не хватает в Prefect, но есть в Apache Airflow, рассмотрит разные парадигмы, стоящие за инструментами. Вы также узнаете, почему нельзя просто взять и переехать с одного инструмента на другой без переосмысления пайплайнов.
Денис Ефаров, Одноклассники
«100 миллиардов сообщений в Kafka: загрузил и забыл»
Apache Kafka — прекрасный инструмент для передачи сообщений между сервисами. Но возможностей Apache Spark не хватило, чтобы выгрузить из него 100 миллиардов сообщений для офлайн-аналитики. Денис расскажет о собственном решении команды, которое позволило выгружать этот объем данных каждый день из Apache Kafka в HDFS без лишних сложностей.
Олег Кочергин, СберЗдоровье
«Ingest-слой платформы данных: смешать, но не взбалтывать»
Вы узнаете о том, как построить Ingest-слой для внутренних и внешних источников — не забывая про работу с чувствительными данными. Олег разберет архитектуру, которую придумала его команда и расскажет про DSL, который управляет всеми компонентами платформы в СберЗдоровье.
Бронислав Житников, Тинькофф
«NIFI-скрипты как элемент Less Code ETL»
В Apache NiFi есть множество трансформаций, которые не требуют кодирования, но они покрывают не все случаи. А разрабатывать процессор на каждую уникальную трансформацию — слишком дорого.
Бронислав Житников расскажет, как с помощью scripting в NiFi можно получить более гибкий инструмент трансформации данных. Вы узнаете, когда следует выбрать скрипт и как это сделать наиболее эффективно. Доклад будет полезен для активных пользователей NiFi, а так же для тех кто рассматривает NiFi в качестве ETL-инструмента для своих задач.
Валерия Дымбицкая, oneFactor
«Автоматический тюнинг Spark-приложений»
Валерия расскажет про систему автоматического тюнинга для Hadoop-кластера, где запускаются сотни ежедневных и тысячи ежечасных Spark-расчетов, каждый со своим SLA.
Из доклада вы узнаете:
— Как извлечь полезную информацию из логов Spark.
— Как подобрать оптимальную память для расчета на основе истории запуска.
— Как автоматизировать процесс и подстраиваться под изменения.
— На что смотреть при автоматическом тюнинге spark.executor.memo
Это далеко не все, что ждет вас 29 октября. В программе также:
— доклады об архитектуре платформ, Big Data, DBMS, Data Governance и MLOps / DevOps;
— интервью со спикерами;
— выступления и стенды с активностями от партнеров конференции.
Полная программа и билеты — на сайте: https://bit.ly/3F5G1ex
