ИИ расшифровал общий для человека и мух код запуска генов: как был раскрыт неизменный за 700 миллионов лет механизм ДНК
В каждой клетке человеческого тела содержится около двух метров ДНК, плотно упакованной в клеточном ядре. Эта нить состоит из трех миллиардов пар нуклеотидов — химических букв A, T, G и C. Чтобы клетка могла жить, делиться и выполнять свои функции, информацию с участков ДНК необходимо непрерывно копировать в молекулы матричной РНК. Этот процесс называется транскрипцией, а выполняет его крупный белковый комплекс — РНК-полимераза II.
Главная сложность в работе РНК-полимеразы II заключается в точности посадки на ДНК. Фермент не может начать считывание в случайном месте. Он должен безошибочно найти единственный нуклеотид, с которого начинается структура будущего белка. Этот первый нуклеотид генетики называют сайтом старта транскрипции или координатой «плюс один» (+1 TSS). Если считывание начнется со сдвигом всего на одну или две буквы, весь последующий текст гена будет прочитан с ошибкой, что приведет к синтезу бесполезного или токсичного белка.
Участок ДНК, который направляет РНК-полимеразу точно к точке старта, называется кор-промотором. Он занимает короткий отрезок примерно от 40 нуклеотидов до сайта старта (позиция -40) и до 40 нуклеотидов после него (позиция +40).
У человека гены делятся на два основных класса по типу старта транскрипции:
- Дисперсные промоторы. В них транскрипция начинается не с одной точки, а распределяется по широкой зоне в 50-100 нуклеотидов. Такой тип характерен для генов домашнего хозяйства (это гены, необходимые для поддержания самых важных функций организма), которые работают постоянно во всех тканях с невысокой интенсивностью.
- Фокусные промоторы. В них считывание начинается строго с одной точки или в пределах двух нуклеотидов от нее. Такие промоторы управляют генами, чья активность должна жестко контролироваться: генами эмбрионального развития, иммунитета и ответа на внешние сигналы.
Несмотря на сорок лет изучения транскрипции, биологи не могли точно предсказать, как именно последовательность букв в кор-промоторе определяет силу и точность запуска гена. Исследовательская группа из Калифорнийского университета в Сан-Диего под руководством профессора Джеймса Кадонаги (James T. Kadonaga) применила методы машинного обучения, чтобы решить эту задачу. Результаты их работы опубликованы в журнале Genes & Development.
Содержание
- Почему прежние методы давали сбой
- Синтез полумиллиона вариантов и алгоритмы регрессии
- Настоящая распространенность инициатора и консервативность мотива
- Две взаимоисключающие схемы работы кор-промотора
- Специальный протокол: мотив TCT для рибосомных генов
- Функциональное разделение генов в организме
- Прикладное значение и нерешенные вопросы
Почему прежние методы давали сбой
Долгое время структуру промоторов описывали через так называемые консенсусные последовательности. Ученые брали группу известных природных генов, накладывали их стартовые участки друг на друга и смотрели, какие буквы встречаются чаще всего. В результате получалась обобщенная формула. Например, для инициатора — короткого участка ДНК, охватывающего точку старта, — долгое время использовалась формула YYCA(+1)YYYYY, где Y означает любой пиримидин (цитозин C или тимин T), а A(+1) — фиксированный аденин в точке старта.
У такого подхода было три фундаментальных ограничения:
- Качественный, а не количественный характер. Консенсус говорит лишь о том, похожа ли последовательность на средний образец, но не способен оценить, сколько молекул РНК синтезирует данный промотор в единицу времени.
- Игнорирование контекста. Замена одной буквы может полностью нейтрализовать действие соседних нуклеотидов, но усредненные формулы не учитывают эти сложные нелинейные зависимости.
- Эволюционный шум. В геноме человека всего около двадцати тысяч генов, кодирующих белки. На их последовательности влияло множество случайных факторов эволюции, хромосомное окружение и эпигенетические метки. Из этой ограниченной выборки невозможно вывести строгие физико-химические законы взаимодействия белков с ДНК.
Синтез полумиллиона вариантов и алгоритмы регрессии
Чтобы получить чистые экспериментальные данные, авторы работы использовали метод HARPE (высокопроизводительный анализ рандомизированных промоторных элементов).
Вместо анализа существующих генов исследователи создали стандартизированную искусственную основу ДНК, в которой участок вокруг точки старта (длиной в 10 или 14 нуклеотидов) был полностью рандомизирован. В результате синтезировали библиотеки, содержащие более 500 000 уникальных комбинаций нуклеотидов.
Каждую такую библиотеку поместили в условия, где происходит транскрипция. Эксперименты провели в двух форматах:
- In vitro — в бесклеточных экстрактах из ядер клеток линии HeLa, содержащих все базовые белковые факторы транскрипции.
- In vivo — путем введения синтетических конструкций непосредственно в живые клетки HeLa.
Количество синтезированной РНК для каждого варианта последовательности измерили с помощью секвенирования нового поколения, подсчитывая молекулярные штрихкоды.
Полученный массив данных использовали для обучения алгоритма машинного обучения — регрессии опорных векторов (Support Vector Regression, SVR). Алгоритм проанализировал 200 000 вариантов последовательностей и научился связывать состав букв в зоне старта с точным числовым значением транскрипционной активности. При проверке на независимых тестовых наборах данных точность предсказания составила более 90% (коэффициент корреляции Пирсона от 0,88 до 0,95).
Настоящая распространенность инициатора и консервативность мотива
Применение обученных моделей к геному человека позволило впервые получить объективную картину распространенности регуляторных элементов.
Ранее считалось, что инициатор присутствует только в 40-56% фокусных промоторов человека. Моделирование показало, что активный инициатор содержится примерно в 60% таких промоторов.
Алгоритм также определил минимальную функциональную последовательность инициатора для человека. Ей оказался четырехбуквенный мотив:
CA(+1)NW (где N — любой нуклеотид, а W — аденин или тимин)
Наиболее неожиданным результатом стал расчет оптимальной, максимально сильной последовательности инициатора. Для человеческих клеток этой последовательностью оказался мотив:
TCA(+1)KTY (где K — гуанин или тимин, а Y — цитозин или тимин)
Этот мотив абсолютно идентичен оптимальному инициатору плодовой мушки Drosophila melanogaster. Человек и насекомые разделились в ходе эволюции около 700 миллионов лет назад. Состав их геномов кардинально изменился: ДНК человека обогащена парами гуанин-цитозин, тогда как геном дрозофилы содержит больше аденина и тимина.
Несмотря на это, пространственная структура и химические свойства основного транскрипционного фактора TFIID — белка, который распознает кор-промотор и связывается с ним, остались неизменными со времен общих предков всех многоклеточных животных.
Две взаимоисключающие схемы работы кор-промотора
Помимо инициатора, в кор-промоторе могут присутствовать два других важных элемента:
- ТАТА-бокс — богатый аденином и тимином участок, расположенный примерно за 30 нуклеотидов до старта (позиция -30).
- DPR (Downstream Promoter Region) — область, расположенная после точки старта, на отрезке от +17 до +35 нуклеотидов.
Модели машинного обучения показали, как эти три элемента взаимодействуют между собой. Выяснилось, что в клетках человека существуют две принципиально разные архитектуры промоторов.
1. Тандемная архитектура: строгая синергия Inr и DPR
В промоторах, где отсутствует ТАТА-бокс, транскрипция опирается на связку инициатора и элемента DPR. В этой системе элементы работают строго кооперативно: их совместная активность во много раз превышает сумму активностей каждого элемента по отдельности.
Качество последовательности инициатора здесь играет решающую роль: замена слабого инициатора на оптимальный увеличивает выход РНК более чем в 100 раз. При этом расстояние между Inr и DPR фиксировано с точностью до одного нуклеотида. Белковый комплекс TFIID одновременно контактирует с обоими участками ДНК, и любое нарушение дистанции делает связывание невозможным.
2. ТАТА-зависимая архитектура: независимость и гибкость
Если в промоторе присутствует сильный ТАТА-бокс, ситуация меняется. Сильный ТАТА-элемент способен самостоятельно привлечь транскрипционный комплекс и запустить синтез РНК даже при полном отсутствии активного инициатора или DPR. В таком окружении вариация последовательности инициатора изменяет силу транскрипции всего в 10 раз.
В природных генах человека обнаружена выраженная обратная зависимость: чем сильнее в гене ТАТА-бокс, тем реже в нем встречается классический инициатор.
Благодаря автономии ТАТА-бокса становится возможной работа нестандартных инициаторов. Исследователи обнаружили новый подтип — A(+3)-вариант Inr, в котором стартовый аденин сдвинут на две позиции вперед относительно канонического положения.
В DPR-промоторах этот вариант полностью нефункционален, так как нарушает жесткое расстояние до нижнего элемента. Однако ТАТА-бокс успешно работает с этой смещенной последовательностью. A(+3)-вариант обнаружен в 8,3% всех ТАТА-содержащих промоторов человека и в 4,6% промоторов дрозофилы.
Специальный протокол: мотив TCT для рибосомных генов
В геноме существует группа генов, которая подчиняется отдельному правилу. Это гены белков рибосом и факторов трансляции — молекулярных структур, собирающих все белки в клетке.
Их промоторы содержат особый мотив — TCT (YC(+1)TYTYY). Он расположен точно на месте инициатора, но вместо аденина в точке старта содержит цитозин.
Эксперименты показали существенную разницу в работе этого мотива в различных условиях:
- В бесклеточных экстрактах (in vitro) TCT-промоторы практически не работают.
- В живых клетках (in vivo) TCT-промоторы демонстрируют крайне высокую активность.
Причина этой разницы заключается в том, что мотив TCT обслуживается специализированным транскрипционным фактором TRF2, а не классическим белком TBP, входящим в состав TFIID. В бесклеточных экстрактах компоненты этого специализированного пути инактивируются или отсутствуют.
Кроме того, авторы выявили межвидовое различие: у дрозофилы мотив TCT никогда не встречается вместе с ТАТА-боксом, тогда как в геноме человека эти два элемента часто присутствуют в одном и том же промоторе.
Функциональное разделение генов в организме
Анализ генных онтологий (классификации генов по их биологической роли) показал, что различные архитектуры промоторов сформировались для решения разных регуляторных задач клетки.
- Промоторы с одним ТАТА-боксом (без Inr и без DPR) сосредоточены в генах, отвечающих за быстрый ответ на изменения внешней среды. Это гены иммунной системы, воспалительных реакций, передачи межклеточных сигналов и ответа на стресс. Сильный ТАТА-бокс позволяет мгновенно активировать транскрипцию в ответ на стрессовый фактор.
- Промоторы тандемного типа (Inr вместе с DPR) управляют генами с плавной и стабильной регуляцией. Они задействованы в процессах тканевой дифференцировки и эмбрионального развития, где критически важна точная дозировка синтезируемых белков без резких скачков.
Прикладное значение и нерешенные вопросы
Созданные математические модели авторы объединили в программный инструмент SVRpredict. py, доступный для научного сообщества. Этот алгоритм позволяет ввести любую последовательность нуклеотидов длиной 10 или 14 пар оснований и мгновенно получить числовую оценку ее способности запускать транскрипцию.
Этот результат важен для двух прикладных областей:
- Синтетическая биология. При создании искусственных генетических конструкций (например, для генной терапии или клеточной инженерии) исследователям необходимо задавать точный базовый уровень производства нужного белка. Теперь эту силу можно программировать непосредственно в точке старта транскрипции, изменяя последовательность инициатора по расчетным формулам, не перегружая конструкцию сложными внешними регуляторными элементами.
- Медицинская генетика. При полногеномном секвенировании пациентов врачи находят тысячи мутаций в некодирующих участках ДНК. До сих пор было трудно определить, нарушает ли точечная замена буквы в промоторе работу жизненно важного гена. Модели SVR дают возможность напрямую рассчитывать, как конкретная мутация в точке старта изменит уровень экспрессии онкогена или опухолевого супрессора.
При этом работа выявила фундаментальный пробел в современных знаниях о геноме. Около 30% фокусных промоторов человека не содержат ни одного из известных мотивов: у них нет ни ТАТА-бокса, ни инициатора, ни DPR, ни TCT. Тем не менее РНК-полимераза II безошибочно находит в них сайт старта +1.
Поиск пока неизвестных последовательностей ДНК и белковых факторов, которые управляют этой третью человеческих генов, станет следующей фундаментальной задачей молекулярной биологии.
Источник: Genes & Development





2 комментария
Добавить комментарий