ИИ расшифровал общий для человека и мух код запуска генов: как был раскрыт неизменный за 700 миллионов лет механизм ДНК

Пост опубликован в блогах iXBT.com, его автор не имеет отношения к редакции iXBT.com
| Статья | Наука и космос

В каждой клетке человеческого тела содержится около двух метров ДНК, плотно упакованной в клеточном ядре. Эта нить состоит из трех миллиардов пар нуклеотидов — химических букв A, T, G и C. Чтобы клетка могла жить, делиться и выполнять свои функции, информацию с участков ДНК необходимо непрерывно копировать в молекулы матричной РНК. Этот процесс называется транскрипцией, а выполняет его крупный белковый комплекс — РНК-полимераза II.

Главная сложность в работе РНК-полимеразы II заключается в точности посадки на ДНК. Фермент не может начать считывание в случайном месте. Он должен безошибочно найти единственный нуклеотид, с которого начинается структура будущего белка. Этот первый нуклеотид генетики называют сайтом старта транскрипции или координатой «плюс один» (+1 TSS). Если считывание начнется со сдвигом всего на одну или две буквы, весь последующий текст гена будет прочитан с ошибкой, что приведет к синтезу бесполезного или токсичного белка.

Молекулярная сцена старта транскрипции, вольная интерпретация
Молекулярная сцена старта транскрипции, вольная интерпретация
Автор: ИИ Copilot Designer//DALL·E 3 Источник: www.bing.com

Участок ДНК, который направляет РНК-полимеразу точно к точке старта, называется кор-промотором. Он занимает короткий отрезок примерно от 40 нуклеотидов до сайта старта (позиция -40) и до 40 нуклеотидов после него (позиция +40).

У человека гены делятся на два основных класса по типу старта транскрипции:

  1. Дисперсные промоторы. В них транскрипция начинается не с одной точки, а распределяется по широкой зоне в 50-100 нуклеотидов. Такой тип характерен для генов домашнего хозяйства (это гены, необходимые для поддержания самых важных функций организма), которые работают постоянно во всех тканях с невысокой интенсивностью.
  2. Фокусные промоторы. В них считывание начинается строго с одной точки или в пределах двух нуклеотидов от нее. Такие промоторы управляют генами, чья активность должна жестко контролироваться: генами эмбрионального развития, иммунитета и ответа на внешние сигналы.

Несмотря на сорок лет изучения транскрипции, биологи не могли точно предсказать, как именно последовательность букв в кор-промоторе определяет силу и точность запуска гена. Исследовательская группа из Калифорнийского университета в Сан-Диего под руководством профессора Джеймса Кадонаги (James T. Kadonaga) применила методы машинного обучения, чтобы решить эту задачу. Результаты их работы опубликованы в журнале Genes & Development.

Почему прежние методы давали сбой

Долгое время структуру промоторов описывали через так называемые консенсусные последовательности. Ученые брали группу известных природных генов, накладывали их стартовые участки друг на друга и смотрели, какие буквы встречаются чаще всего. В результате получалась обобщенная формула. Например, для инициатора — короткого участка ДНК, охватывающего точку старта, — долгое время использовалась формула YYCA(+1)YYYYY, где Y означает любой пиримидин (цитозин C или тимин T), а A(+1) — фиксированный аденин в точке старта.

У такого подхода было три фундаментальных ограничения:

  • Качественный, а не количественный характер. Консенсус говорит лишь о том, похожа ли последовательность на средний образец, но не способен оценить, сколько молекул РНК синтезирует данный промотор в единицу времени.
  • Игнорирование контекста. Замена одной буквы может полностью нейтрализовать действие соседних нуклеотидов, но усредненные формулы не учитывают эти сложные нелинейные зависимости.
  • Эволюционный шум. В геноме человека всего около двадцати тысяч генов, кодирующих белки. На их последовательности влияло множество случайных факторов эволюции, хромосомное окружение и эпигенетические метки. Из этой ограниченной выборки невозможно вывести строгие физико-химические законы взаимодействия белков с ДНК.

Синтез полумиллиона вариантов и алгоритмы регрессии

Чтобы получить чистые экспериментальные данные, авторы работы использовали метод HARPE (высокопроизводительный анализ рандомизированных промоторных элементов).

Вместо анализа существующих генов исследователи создали стандартизированную искусственную основу ДНК, в которой участок вокруг точки старта (длиной в 10 или 14 нуклеотидов) был полностью рандомизирован. В результате синтезировали библиотеки, содержащие более 500 000 уникальных комбинаций нуклеотидов.

Каждую такую библиотеку поместили в условия, где происходит транскрипция. Эксперименты провели в двух форматах:

  1. In vitro — в бесклеточных экстрактах из ядер клеток линии HeLa, содержащих все базовые белковые факторы транскрипции.
  2. In vivo — путем введения синтетических конструкций непосредственно в живые клетки HeLa.

Количество синтезированной РНК для каждого варианта последовательности измерили с помощью секвенирования нового поколения, подсчитывая молекулярные штрихкоды.

Полученный массив данных использовали для обучения алгоритма машинного обучения — регрессии опорных векторов (Support Vector Regression, SVR). Алгоритм проанализировал 200 000 вариантов последовательностей и научился связывать состав букв в зоне старта с точным числовым значением транскрипционной активности. При проверке на независимых тестовых наборах данных точность предсказания составила более 90% (коэффициент корреляции Пирсона от 0,88 до 0,95).

Экспериментальная платформа HARPE и обучение алгоритма SVR. Исследователи создали библиотеку из полумиллиона случайных вариантов ДНК в зоне старта (+1), измерили уровень синтеза РНК с помощью молекулярных штрихкодов и обучили модель машинного обучения точно предсказывать силу любого промотора.
Экспериментальная платформа HARPE и обучение алгоритма SVR. Исследователи создали библиотеку из полумиллиона случайных вариантов ДНК в зоне старта (+1), измерили уровень синтеза РНК с помощью молекулярных штрихкодов и обучили модель машинного обучения точно предсказывать силу любого промотора.
Автор: Rhyne-Carrigg et al. Источник: genesdev.cshlp.org

Настоящая распространенность инициатора и консервативность мотива

Применение обученных моделей к геному человека позволило впервые получить объективную картину распространенности регуляторных элементов.

Ранее считалось, что инициатор присутствует только в 40-56% фокусных промоторов человека. Моделирование показало, что активный инициатор содержится примерно в 60% таких промоторов.

Алгоритм также определил минимальную функциональную последовательность инициатора для человека. Ей оказался четырехбуквенный мотив:

CA(+1)NW (где N — любой нуклеотид, а W — аденин или тимин)

Наиболее неожиданным результатом стал расчет оптимальной, максимально сильной последовательности инициатора. Для человеческих клеток этой последовательностью оказался мотив:

TCA(+1)KTY (где K — гуанин или тимин, а Y — цитозин или тимин)

Этот мотив абсолютно идентичен оптимальному инициатору плодовой мушки Drosophila melanogaster. Человек и насекомые разделились в ходе эволюции около 700 миллионов лет назад. Состав их геномов кардинально изменился: ДНК человека обогащена парами гуанин-цитозин, тогда как геном дрозофилы содержит больше аденина и тимина.

Несмотря на это, пространственная структура и химические свойства основного транскрипционного фактора TFIID — белка, который распознает кор-промотор и связывается с ним, остались неизменными со времен общих предков всех многоклеточных животных.

Две взаимоисключающие схемы работы кор-промотора

Помимо инициатора, в кор-промоторе могут присутствовать два других важных элемента:

  • ТАТА-бокс — богатый аденином и тимином участок, расположенный примерно за 30 нуклеотидов до старта (позиция -30).
  • DPR (Downstream Promoter Region) — область, расположенная после точки старта, на отрезке от +17 до +35 нуклеотидов.

Модели машинного обучения показали, как эти три элемента взаимодействуют между собой. Выяснилось, что в клетках человека существуют две принципиально разные архитектуры промоторов.

1. Тандемная архитектура: строгая синергия Inr и DPR

В промоторах, где отсутствует ТАТА-бокс, транскрипция опирается на связку инициатора и элемента DPR. В этой системе элементы работают строго кооперативно: их совместная активность во много раз превышает сумму активностей каждого элемента по отдельности.

Качество последовательности инициатора здесь играет решающую роль: замена слабого инициатора на оптимальный увеличивает выход РНК более чем в 100 раз. При этом расстояние между Inr и DPR фиксировано с точностью до одного нуклеотида. Белковый комплекс TFIID одновременно контактирует с обоими участками ДНК, и любое нарушение дистанции делает связывание невозможным.

2. ТАТА-зависимая архитектура: независимость и гибкость

Если в промоторе присутствует сильный ТАТА-бокс, ситуация меняется. Сильный ТАТА-элемент способен самостоятельно привлечь транскрипционный комплекс и запустить синтез РНК даже при полном отсутствии активного инициатора или DPR. В таком окружении вариация последовательности инициатора изменяет силу транскрипции всего в 10 раз.

В природных генах человека обнаружена выраженная обратная зависимость: чем сильнее в гене ТАТА-бокс, тем реже в нем встречается классический инициатор.

Благодаря автономии ТАТА-бокса становится возможной работа нестандартных инициаторов. Исследователи обнаружили новый подтип — A(+3)-вариант Inr, в котором стартовый аденин сдвинут на две позиции вперед относительно канонического положения.

В DPR-промоторах этот вариант полностью нефункционален, так как нарушает жесткое расстояние до нижнего элемента. Однако ТАТА-бокс успешно работает с этой смещенной последовательностью. A(+3)-вариант обнаружен в 8,3% всех ТАТА-содержащих промоторов человека и в 4,6% промоторов дрозофилы.

Эволюционная консервативность старта генов у человека (вверху) и дрозофилы (внизу). Модели ИИ выявили три варианта инициатора в зависимости от положения ключевого аденина (A+1, A+2 и A+3). Вариант A+3 работает исключительно в паре с ТАТА-боксом и одинаково представлен в геномах обоих видов.
Эволюционная консервативность старта генов у человека (вверху) и дрозофилы (внизу). Модели ИИ выявили три варианта инициатора в зависимости от положения ключевого аденина (A+1, A+2 и A+3). Вариант A+3 работает исключительно в паре с ТАТА-боксом и одинаково представлен в геномах обоих видов.
Автор: Rhyne-Carrigg et al. Источник: genesdev.cshlp.org

Специальный протокол: мотив TCT для рибосомных генов

В геноме существует группа генов, которая подчиняется отдельному правилу. Это гены белков рибосом и факторов трансляции — молекулярных структур, собирающих все белки в клетке.

Их промоторы содержат особый мотив — TCT (YC(+1)TYTYY). Он расположен точно на месте инициатора, но вместо аденина в точке старта содержит цитозин.

Эксперименты показали существенную разницу в работе этого мотива в различных условиях:

  • В бесклеточных экстрактах (in vitro) TCT-промоторы практически не работают.
  • В живых клетках (in vivo) TCT-промоторы демонстрируют крайне высокую активность.

Причина этой разницы заключается в том, что мотив TCT обслуживается специализированным транскрипционным фактором TRF2, а не классическим белком TBP, входящим в состав TFIID. В бесклеточных экстрактах компоненты этого специализированного пути инактивируются или отсутствуют.

Кроме того, авторы выявили межвидовое различие: у дрозофилы мотив TCT никогда не встречается вместе с ТАТА-боксом, тогда как в геноме человека эти два элемента часто присутствуют в одном и том же промоторе.

Функциональное разделение генов в организме

Анализ генных онтологий (классификации генов по их биологической роли) показал, что различные архитектуры промоторов сформировались для решения разных регуляторных задач клетки.

  1. Промоторы с одним ТАТА-боксом (без Inr и без DPR) сосредоточены в генах, отвечающих за быстрый ответ на изменения внешней среды. Это гены иммунной системы, воспалительных реакций, передачи межклеточных сигналов и ответа на стресс. Сильный ТАТА-бокс позволяет мгновенно активировать транскрипцию в ответ на стрессовый фактор.
  2. Промоторы тандемного типа (Inr вместе с DPR) управляют генами с плавной и стабильной регуляцией. Они задействованы в процессах тканевой дифференцировки и эмбрионального развития, где критически важна точная дозировка синтезируемых белков без резких скачков.
Геномный анализ взаимосвязи элементов промотора. Данные подтверждают строгую синергию между инициатором (Inr) и нижним элементом (DPR), а также обратную зависимость между ТАТА-боксом и инициатором: чем сильнее ТАТА-бокс гена, тем реже ему требуется активный инициатор.
Геномный анализ взаимосвязи элементов промотора. Данные подтверждают строгую синергию между инициатором (Inr) и нижним элементом (DPR), а также обратную зависимость между ТАТА-боксом и инициатором: чем сильнее ТАТА-бокс гена, тем реже ему требуется активный инициатор.
Автор: Rhyne-Carrigg et al. Источник: genesdev.cshlp.org

Прикладное значение и нерешенные вопросы

Созданные математические модели авторы объединили в программный инструмент SVRpredict. py, доступный для научного сообщества. Этот алгоритм позволяет ввести любую последовательность нуклеотидов длиной 10 или 14 пар оснований и мгновенно получить числовую оценку ее способности запускать транскрипцию.

Этот результат важен для двух прикладных областей:

  • Синтетическая биология. При создании искусственных генетических конструкций (например, для генной терапии или клеточной инженерии) исследователям необходимо задавать точный базовый уровень производства нужного белка. Теперь эту силу можно программировать непосредственно в точке старта транскрипции, изменяя последовательность инициатора по расчетным формулам, не перегружая конструкцию сложными внешними регуляторными элементами.
  • Медицинская генетика. При полногеномном секвенировании пациентов врачи находят тысячи мутаций в некодирующих участках ДНК. До сих пор было трудно определить, нарушает ли точечная замена буквы в промоторе работу жизненно важного гена. Модели SVR дают возможность напрямую рассчитывать, как конкретная мутация в точке старта изменит уровень экспрессии онкогена или опухолевого супрессора.

При этом работа выявила фундаментальный пробел в современных знаниях о геноме. Около 30% фокусных промоторов человека не содержат ни одного из известных мотивов: у них нет ни ТАТА-бокса, ни инициатора, ни DPR, ни TCT. Тем не менее РНК-полимераза II безошибочно находит в них сайт старта +1.

Поиск пока неизвестных последовательностей ДНК и белковых факторов, которые управляют этой третью человеческих генов, станет следующей фундаментальной задачей молекулярной биологии.

Источник: Genes & Development

2 комментария

k
ну охренеть прям как в компах древних где программа тоже на длинную ленту записана была и тоже специальная последовательность байтов с теми же целями…
n
Офигеть как сложно и неизведанно

Добавить комментарий

Сейчас на главной

Новости

Публикации

Живем ли мы в симуляции? Если да, то законы физики доказывают: мы в ней подопытные, а не игроки

Гипотеза о том, что окружающий мир представляет собой искусственно созданную среду, давно вышла за рамки умозрительной философии. Развитие теоретической физики, квантовой механики и теории...

101 километр между Волгой и Доном: зачем СССР соединил две великие реки

Если посмотреть на карту возле Волгограда, замысел кажется почти очевидным. Волга и Дон подходят друг к другу так близко, будто человеку осталось провести между ними одну линию. По Волге можно...

Три экологические формы байкальского омуля: как калибровка жаберных тычинок разделила один вид

Анатомический подсчет выростов на первой жаберной дуге байкальского омуля (Coregonus migratorius) дает строго фиксированный разброс: от 36 до 55 шт. Если у выловленной рыбы зафиксировано менее 41...

Этот лед горячее расплавленной стали: физики открыли новую форму воды в недрах планет-гигантов

Магнитные поля Земли, Юпитера и Сатурна имеют форму правильного диполя. Их силовые линии выходят из областей вблизи географических полюсов, а центр магнитного диполя практически совпадает с центром...

От рыбацкой деревушки до киберпанка: чем может удивить самый современный город мира Шэньчжэнь

В 1980 году Шэньчжэнь был одной большой рыбацкой деревней с рисовыми полями, тиной и парой тысяч бедных рыбаков с бесконечными рядами сушащихся на солнце карасей. Казалось, чтобы хотя бы...

Почему рябина иногда месяцами висит почти нетронутой, а потом птицы объедают дерево буквально за несколько дней

Осенняя рябина умеет долго выглядеть так, будто птицы её совершенно игнорируют. Гроздья висят яркими, тяжёлыми, заметными издалека, листья уже опали, вокруг почти не осталось другой растительной...