Интервью с Жавлоном Исомуродовым
Расскажи, пожалуйста, про свою работу.
Моя магистерская диссертация была посвящена разработке методов для нахождения активного модуля в графе.
Возьмем, например, людей с онкологическим диагнозом. За развитие заболевания обычно отвечает группа генов, и гены в группе так или иначе взаимодействуют между собой. Если мы влияем на один из них, пусть это будет ген Х, скорее всего, мы увидим изменения в функционировании других генов в группе. Мы хотим понять, как воздействие на ген Х способно повлиять на другие гены.
То есть ты изучаешь взаимосвязь между разными генами? Зачем нам влиять на ген Х?
Да. Влияя на один ген, у нас есть возможность изменить работу других генов в группе. Воздействуя на определенный ген, можно повлиять на течение болезни, а в отдельных случаях можно устранить саму причину заболевания.
Основная задача состоит в том, чтобы найти активный модуль. Активный модуль в данном случае — это совокупность генов, разделяющих общую клеточную функцию. Моя работа как раз заключалась в том, чтобы ранжировать гены по степени уверенности в их принадлежности активному модулю.
Как долго ты работал над этой задачей?
Я занимаюсь этим с сентября 2016 года, с момента поступления в магистратуру. Я работаю с Никитой Алексеевым, Александром Лободой и с Алексеем Сергушичевым.
На самом деле для задачи по поиску активного модуля уже существует решение. Есть два основных подхода: с помощью алгоритма имитации отжига и с помощью поиска подграфа максимального веса.
Что такое подграф максимального веса?
Здесь речь идет о том, чтобы объяснить биологические феномены языком математики. У нас есть данные об экспрессии генов, а еще существуют статистические методы, извлекающие значения правдоподобия из этих данных. Таким образом, можно понять, принадлежит ли ген активному модулю. В нашей задаче правдоподобие — это вес гена. В итоге нужно найти такой подграф, правдоподобие которого будет максимально.
Маркус Дитрих и его коллеги в 2008 году предложили свести задачу поиска максимально правдоподобного подграфа к задаче поиска подграфа максимального веса. С помощью этого метода можно найти оптимальный активный модуль. Но есть одно «но». Веса в вершинах зависят от некоторого порогового значения. Под порогом здесь подразумевается ожидаемая доля ложного отклонения, а под вершинами — гены.
Порог — это ошибка, верно?
Да. Порог — это доля ошибки, которую мы готовы допустить. Порог можно контролировать. И в зависимости от величины порога получаются разные подграфы. Если мы ставим строгий порог, у нас получится небольшой подграф. Когда мы ослабляем порог, то новый подграф должен включать в себя какие-то дополнительные вершины, и при этом все вершины из решения более сильного порога тоже должны находиться внутри. Но метод, который предложил Дитрих с коллегами, работает не так. Ответы не соответствуют друг другу.
То есть если ты меняешь порог, меняются вершины, а это критично?
Именно. Например, для строгого порога решение одно, и более вероятно, что вершины принадлежат активному модулю. Когда я ослабляю порог, разрешаю большую долю ошибки, подграф изменяется, и какие-то вершины в него уже не входят. То есть появляются новые «менее убедительные» вершины, но какие-то «более убедительные» вершины мы при этом теряем, что не очень хорошо, само собой.
Как появилась идея такой работы?
Когда я поступил в магистратуру, Алексей предложил мне заняться описанной задачей. Причем он предложил не искать модуль для определенного порога, а ранжировать вершины. Это делается для того, чтобы решить проблему несоответствия решений.
Значит ты занимаешься усовершенствованием методики, которая уже существует? Делаешь так, чтобы при ослаблении порога не выпадали важные вершины?
Не совсем, моя задача более глобальная и автоматически разрешает несогласованность. Я скорее оцениваю, сравниваю вершины.
Моя магистерская работа отличалась от предшествующих работ в области тем, что я решал задачу ранжирования вершин, а не задачу бинарной классификации. К моменту защиты диссертации мы с коллегами разработали два метода ранжирования и метод, с помощью которого можно определить вероятность принадлежности гена к активному модулю. Преимущество заключается в том, что можно взять группу вершин и оценить, с какой вероятностью подграф является активным модулем. Это значит, что можно оценить долю ложного предсказания. Мы также можем оценивать вероятность наличия связи между двумя определенными генами.
Иллюстрация работы алгоритма MCMC. Вершины окрашены в зависимости от их правдоподобия. Бордовые вершины — это вершины с высоким правдоподобием, серые — с низким. Желтый подграф — активный модуль.
Текст: Ксения Спиридонова
