Онлайн-митап в лаборатории МФТИ-Яндекс
Лаборатория фундаментальных исследований МФТИ-Яндекс приглашает вас принять участие в онлайн-митапе, который состоится 19 марта в 18:30. Для участия переходите по ссылке.
Лаборатория фундаментальных исследований МФТИ-Яндекс — научное подразделение МФТИ, созданное совместно с Yandex Research. В лаборатории ведутся исследования по следующим тематикам: машинное обучение, компьютерное зрение, информационный поиск, рекомендательные системы, обработка естественного языка и машинный перевод.
В рамках мероприятия исследователи из Yandex Research расскажут об интересных задачах, которыми они занимаются, а ещё о том, как стать частью команды.
Рассказывать о своей работе и отвечать на все ваши вопросы будут:
- Артём Бабенко. Navigating the GAN Parameter Space for Semantic Image Editing;
- Максим Рябинин. It's All in the Heads: Attention Heads for Cross-Lingual Commonsense Reasoning;
- Людмила Прохоренкова. Boost then Convolve: Gradient Boosting Meets Graph Neural Networks;
- Валентин Хрульков. Functional Space Analysis of Local GAN Convergence;
- Андрей Малинин. Uncertainty Estimation in Autoregressive Structured Prediction.
Navigating the GAN Parameter Space for Semantic Image Editing
Артём Бабенко
Generative Adversarial Networks (GANs) are currently an indispensable tool for image editing, being a standard component of image-to-image translation and image restoration methods. In this talk, we describe new algorithms that significantly expand the range of visual effects achievable with the state-of-the-art models, like StyleGAN2. Namely, we explore the space of the generator parameters and demonstrate that it contains a plethora of interpretable directions, which are an excellent source of non-trivial semantic manipulations, unattainable by previous approaches.
It's All in the Heads: Attention Heads for Cross-Lingual Commonsense Reasoning
Максим Рябинин
За последние несколько лет область NLP совершила заметный скачок благодаря большим Transformer-моделям, однако многие важные задачи не решены до сих пор. В их числе проблема commonsense reasoning, которая задействует не только понимание входного текста, но и общие представления о мире. BERT и его аналоги активно сравнивают на этой задаче, однако почти все исследования ведутся только на англоязычных выборках: на других языках и данных, и моделей меньше.
Я расскажу, как мы собрали бенчмарк для commonsense reasoning на разных языках (в том числе на русском) и с его помощью обнаружили интересное свойство многоязычных архитектур. Оказывается, буквально несколько голов внимания кодируют информацию, важную для commonsense reasoning, причем набор «важных» голов один и тот же для разных языков. Это позволило нам применить веса self-attention как признаки для обычного линейного классификатора и обойти по результатам полный файнтюнинг, обучаясь на одном языке и тестируясь на всех остальных.
Boost then Convolve: Gradient Boosting Meets Graph Neural Networks
Людмила Прохоренкова
Графовые нейронные сети (GNN) успешно применяются для решения различных задач на графах. С другой стороны, градиентный бустинг над решающими деревьями (GBDT) часто превосходит другие методы при работе с разнородными табличными данным. А что делать в ситуациях, когда вершины графа описываются разнородными табличными факторами? Я расскажу про новую архитектуру, позволяющую обучать GBDT и GNN совместно: GBDT обрабатывает разнородные факторы, в то время как GNN учитывает структуру графа и улучшает предсказания.
Functional Space Analysis of Local GAN Convergence
Валентин Хрульков
Для ускорения и улучшения стабильности обучения ГАНов часто используются разные эвристики (аугментации, нетривиальная оптимизация). Имеющаяся теория сходимости этих моделей никак не объясняет успех этих эвристик. Мы показываем как можно свести (локальную) сходимость ГАНа к системе уравнений в частных производных, свойства которой определяются нашим датасетом. Соответственно, анализируя датасет (например, аугментированный или почищенный) перед обучением модели, мы можем предсказать насколько выгодным будет это преобразование для обучения ГАНа.
Uncertainty Estimation in Autoregressive Structured Prediction
Андрей Малинин
Оценка неопределенности важна для обеспечения безопасности и надежности систем искусственного интеллекта. Большинство исследований в этой области были сосредоточены на задачах неструктурированного прогнозирования, и мало работ было посвящено изучению общих подходов к оценке неопределенности для структурированного прогнозирования. Наша работа направлена на исследование оценки неопределенности для задач авторегрессионного структурированного прогнозирования в рамках единой унифицированной и интерпретируемой вероятностной ансамблевой структуры. Мы рассматриваем: оценку неопределенности в структурном прогрозировании как на уровне последовательности, так и на уровне отдельных токенов. Дополнительно, мы проводим анализ как теоретических, так и практических проблем, связанных с получением этих оценок неопределенности. Мы также предоставляем базовые показатели для обнаружения ошибок на уровне токенов и последовательностей, а также обнаружения внедоменных входных данных на уровне последовательностей в наборах данных англо-французского перевода WMT’14 и англо-немецкого перевода WMT’17 и распознавания речи LibriSpeech.
