Дайджест докладов с offline-дня SmartData 2022 (Architecture of Data Platforms, DBMS)

Дайджест докладов с offline-дня SmartData 2022 (Architecture of Data Platforms, DBMS), image #1

Татьяна Колмакова и Максим Стаценко, Яндекс

«Путь к модели данных для ежедневного апдейта 100 прошлых дней»

Каждый день в Яндекс после обработки, сжатии и упаковки приходят до 10 терабайт данных. Обновления приходят на данные до 100 дней в прошлое, и их используют сотни скриптов и внутренних пользователей. Татьяна и Максим расскажут, почему Data Vault не подошел для работы с такими данными, как ради экономии пришлось отказаться от других красивых решений. Вас ждет история, после которой вы поймете, как выбрать архитектуру и лучший подход, не повторив ошибки команды Яндекса.

Андрей Кузнецов, Одноклассники

«Распределенный высоконагруженный feature store ОК»

Андрей расскажет об архитектуре feature store. Это решение из опенсорсных компонентов, которое уже много лет подтверждает свою эффективность в ОК.

Из доклада вы узнаете:

— Какие уроки по эксплуатации многокластерного feature store в высоконагруженном продакшене выучила команда.

— Почему feature store — не только каталог фичей для дата-сайентистов.

— Что не так с открытыми решениями, и почему они не подходят для больших проектов.

Михаил Марюфич, Одноклассники

«Надежные и масштабируемые пайплайны в OK»

В «Одноклассниках» есть множество рекомендательных систем, которые в реальном времени обрабатывают запросы от миллионов пользователей каждый день. Михаил расскажет, как пайплайны, заливающие датасеты и признаки в feature store, поддерживают качество таких систем. Он также поделится опытом инцидент-менеджмента и быстрой отладки новых решений с помощью dev-контура.

Владимир Озеров, Querify Labs

«Как устроено выполнение SQL-запросов в Presto/Trino»

Presto/Trino — это распределенный SQL-движок с serverless-архитектурой, который позволяет выполнять федеративные запросы по данным произвольного объема. Владимир расскажет, как устроено выполнение таких вопросов — от получения запроса на узле-координаторе до выдачи результата пользователю

Антон Виноградов, Apache Software Foundation

«Восстановление распределенной базы данных после аварии»

Удаленный документ можно восстановить откатом и парой дополнений по памяти. Сгоревший сервер восстанавливается из бэкапа. А что делать с распределенной БД, где ошибка в коде стерла каждое миллионное изменение в каждом кластере?

Антон ответит на этот вопрос и расскажет, что делать, когда код-ревью, failover и сертификация не помогли избежать аварии распределенной базы данных.

Полная программа и билеты — на сайте: https://bit.ly/3N8XmVJ

17 views·1 share