Дайджест докладов: Александр Боргардт, Денис Ефаров, Антон Виноградов, Владимир Озеров, Игорь Мосягин, Валентин Пановский

Дайджест докладов: Александр Боргардт, Денис Ефаров, Антон Виноградов, Владимир Озеров, Игорь Мосягин, Валентин Пановский, image #1

Александр Боргардт, duckstax.com

«Колонки и векторные инструкции»

Если верить определению из Википедии, то векторизация применяется только в колоночных СУБД. На самом деле, она окружает дата-инженера повсюду: NumPy, pandas, Apache Spark, Numba. Александр расскажет, в каких случаях ее использование будет эффективным

Денис Ефаров, Одноклассники

«100 миллиардов сообщений в Kafka: загрузил и забыл»

Apache Kafka — прекрасный инструмент для передачи сообщений между сервисами. Но возможностей Apache Spark не хватило, чтобы выгрузить из него 100 миллиардов сообщений для офлайн-аналитики. Денис расскажет о собственном решении команды, которое позволило выгружать этот объем данных каждый день из Apache Kafka в HDFS без лишних сложностей.

Антон Виноградов, Apache Software Foundation

«Восстановление распределенной базы данных после аварии»

Удаленный документ можно восстановить откатом и парой дополнений по памяти. Сгоревший сервер восстанавливается из бэкапа. А что делать с распределенной БД, где ошибка в коде стерла каждое миллионное изменение в каждом кластере?

Антон ответит на этот вопрос и расскажет, что делать, когда код-ревью, failover и сертификация не помогли избежать аварии распределенной базы данных.

Владимир Озеров, Querify Labs

«Как устроено выполнение SQL-запросов в Trino»

Trino — это распределенный SQL-движок с serverless-архитектурой, который позволяет выполнять федеративные запросы по данным произвольного объема. Владимир расскажет, как устроено выполнение таких вопросов — от получения запроса на узле-координаторе до выдачи результата пользователю

Игорь Мосягин, Klarna

«Хранилище есть, а дальше что? Документация и другие способы улучшить DX ваших коллег»

Какие доки нужны и зачем? Как организовать демо и общение между командами, работающими с вашим хранилищем? Как в этом бардаке сделать так, чтобы аналитики понимали, чего от них хотят инженеры, а менеджеры понимали, какие проблемы у аналитиков?

Игорь расскажет про стили кода, улучшение документации и про то, как сделать так, чтобы все дружили друг с другом в контексте работы с хранилищем данных.

Валентин Пановский, more.tv

«Использование платформы GrowthBook для управления ML-экспериментами»

Поговорим об одном из способов организации пайплайна экспериментов на основе открытой платформы GrowthBook, когда ответственность за запуск и тестирование фич лежит на команде ML-разработчиков. Подход, который представит Валентин, призван уменьшить количество интеграций на стороне основной команды разработки и повысить скорость вывода в продакшен новых версий моделей машинного обучения.

Подробности и билеты на SmartData 2022: https://bit.ly/3T8jAcd

31 views·2 shares