Геномный анализ сложных признаков
Геномный анализ сложных признаков (англ. Genome-wide complex trait analysis, GCTA), также геномный метод оценки ограниченного максимального правдоподобия (англ. Genome-based restricted maximum likelihood, GREML) — это статистический метод оценки наследуемости в генетике, который количественно определяет общий аддитивный вклад набора генетических вариантов в признак. GCTA обычно применяется к распространённым однонуклеотидным полиморфизмам (SNP) на генотипирующем чипе и поэтому называется «чиповой» или «SNP-наследуемостью».
GCTA работает путём прямого количественного определения случайного генетического сходства неродственных индивидов и сравнения его с их измеренным сходством по признаку; если два неродственных индивида относительно схожи генетически и также имеют схожие значения признака, то измеренная генетика, вероятно, причинно влияет на этот признак, и корреляция может в определённой степени показать, насколько сильно. Это можно проиллюстрировать построением графика квадратов попарных различий признака между индивидами в зависимости от их оценённой степени родства[1]. GCTA делает ряд модельных предположений, и вопрос о том, когда эти предположения выполняются, остаётся предметом обсуждения.
Фреймворк GCTA был также расширен по ряду направлений: количественная оценка вклада различных категорий SNP (то есть функциональное разбиение); оценка вклада взаимодействий генов и среды; оценка вклада неаддитивных/нелинейных эффектов SNP; а также бивариантный анализ нескольких фенотипов для оценки их генетической ковариации (совместная наследуемость или генетическая корреляция).
Оценки GCTA имеют значение для потенциала открытий в геномных ассоциативных исследованиях (GWAS) и для проектирования и точности полигенных баллов. Оценки GCTA по распространённым вариантам обычно существенно ниже других оценок общей или узкосмысловой наследуемости (например, по близнецовым или родственным исследованиям), что способствовало дискуссии о проблеме недостающей наследуемости.
Общие сведения
| GCTA | |
|---|---|
| Автор | Ян Ян |
| Первый выпуск | 30 августа 2010 |
| Последняя версия | 1.26.0 (2016-06-22[19]) |
| Лицензия |
GPL v3 (исходный код) MIT (исполняемые файлы)[19] |
| Сайт | cnsgenomics.com/software/gcta/ |
История
Оценка в биологии/животноводстве с использованием стандартных методов ANOVA/REML для компонентов дисперсии, таких как наследуемость, общий вклад среды, материнские эффекты и др., обычно требует индивидов с известной степенью родства, например, родитель/потомок; это часто недоступно или данные о родословной ненадёжны, что приводит к невозможности применения методов или требует строгого лабораторного контроля всего разведения (что угрожает внешней валидности всех оценок). Несколько авторов отмечали, что степень родства можно измерять напрямую по генетическим маркёрам (и если индивиды достаточно связаны, экономически достаточно получить немного маркёров для статистической мощности), что привело Кермита Ритланда в 1996 году к предложению напрямую сравнивать попарную степень родства с попарными фенотипическими измерениями (Ritland 1996, «A Marker-based Method for Inferences About Quantitative Inheritance in Natural Populations» [2]).
С резким снижением стоимости секвенирования генома в 2000-х годах стало возможным получение достаточного количества маркёров у достаточного числа субъектов для надёжных оценок с использованием очень отдалённо родственных индивидов. Раннее применение метода к человеку было осуществлено в работах Visscher и др. 2006[3]/2007[4], где использовались SNP-маркёры для оценки фактической степени родства между сиблингами и оценки наследуемости по прямым генетическим данным. У человека, в отличие от исходных животных/растительных приложений, степень родства обычно известна с высокой точностью в «дикой популяции», и преимущество GCTA связано скорее с избеганием предположений классических дизайнов поведенческой генетики и верификацией их результатов, а также с разбиением наследуемости по классам SNP и хромосомам. Первое применение GCTA к человеку было опубликовано в 2010 году, показав, что 45 % дисперсии роста человека может быть объяснено включёнными SNP[5][6]. (Крупные GWAS по росту с тех пор подтвердили эту оценку[7].) Алгоритм GCTA был затем описан, а программная реализация опубликована в 2011 году[8]. С тех пор он используется для изучения широкого спектра биологических, медицинских, психиатрических и психологических признаков у человека и вдохновил множество вариантов подхода.
Преимущества
Надёжная наследуемость
Близнецовые и семейные исследования давно используются для оценки доли дисперсии, объясняемой определёнными категориями генетических и средовых причин. Для широкого спектра изученных человеческих признаков обычно наблюдается минимальное влияние общей среды, значительное влияние неразделяемой среды и крупный генетический компонент (в основном аддитивный), который в среднем составляет около 50 % и иногда значительно выше для некоторых признаков, таких как рост или интеллект[9]. Однако близнецовые и семейные исследования подвергаются критике за опору на ряд предположений, которые трудно или невозможно проверить, таких как предположение о равенстве сред (что среды монозиготных и дизиготных близнецов одинаково схожи), отсутствие ошибочной классификации зиготности (ошибочное принятие идентичных за разнояйцевых и наоборот), что близнецы не являются репрезентативными для общей популяции, и отсутствие ассортативного скрещивания. Нарушения этих предположений могут приводить как к завышению, так и к занижению оценок параметров[10]. (Дебаты и критика особенно касаются наследуемости интеллекта.)
Использование данных SNP или всего генома от неродственных участников (слишком родственные участники, обычно >0,025 или ~уровень четвероюродных братьев/сестёр, исключаются, а несколько главных компонент включаются в регрессию для предотвращения и контроля стратификации популяции) позволяет обойти многие проблемы наследуемости: близнецы часто вообще не участвуют, нет вопросов о равном обращении, степень родства оценивается точно, а выборки набираются из широкого круга субъектов.
В дополнение к большей устойчивости к нарушениям предположений близнецовых исследований, данные SNP могут быть проще в сборе, поскольку не требуют редких близнецов, и, следовательно, наследуемость редких признаков также может быть оценена (с учётом коррекции на смещённость отбора).
Мощность GWAS
Оценки GCTA могут быть использованы для разрешения проблемы недостающей наследуемости и планирования GWAS, которые дадут статистически значимые результаты на уровне всего генома. Это достигается путём сравнения оценки GCTA с результатами меньших GWAS. Если GWAS с n=10 000 по данным SNP не даёт ни одного результата, но GCTA указывает на высокую наследуемость, объясняемую SNP, это подразумевает, что вовлечено большое количество вариантов (полигенность), и, следовательно, для точной оценки эффекта каждого SNP и прямого учёта части наследуемости GCTA потребуются гораздо более крупные GWAS.
Недостатки
- Ограниченность выводов: оценки GCTA по своей природе ограничены тем, что не могут оценивать широкосмысловую наследуемость, как близнецовые/семейные исследования, поскольку оценивают только наследуемость, обусловленную SNP. Поэтому, хотя они служат критическим тестом на отсутствие смещения в близнецовых/семейных исследованиях, GCTA не может их заменить для оценки общего генетического вклада в признак.
- Существенные требования к данным: число SNP, генотипированных на человека, должно быть в тысячах, а желательно — в сотнях тысяч для разумных оценок генетического сходства (хотя сейчас это не проблема для современных коммерческих чипов, которые по умолчанию содержат сотни тысяч или миллионы маркёров); а число людей для относительно стабильных оценок SNP-наследуемости должно быть не менее n>1000, а желательно n>10000[11]. В отличие от этого, близнецовые исследования могут давать точные оценки при гораздо меньших выборках.
- Вычислительная неэффективность: исходная реализация GCTA плохо масштабируется с увеличением объёма данных (), поэтому даже если данных достаточно для точных оценок GCTA, вычислительная нагрузка может быть чрезмерной. GCTA может быть мета-анализирована как стандартный мета-анализ с фиксированным эффектом и взвешиванием по точности[12], поэтому исследовательские группы иногда оценивают когорты или подвыборки и затем объединяют их мета-аналитически (ценой дополнительной сложности и некоторой потери точности). Это мотивировало создание более быстрых реализаций и вариантов алгоритмов с иными предположениями, например, с использованием метода моментов.
- Необходимость исходных данных: GCTA требует генетического сходства всех субъектов, а значит, их исходной генетической информации; из-за соображений конфиденциальности индивидуальные данные редко доступны. GCTA нельзя запустить по сводным статистикам, публикуемым многими проектами GWAS, и если объединять несколько оценок GCTA, требуется мета-анализ.
В отличие от этого, существуют альтернативные методы, работающие по сводным данным GWAS без необходимости исходных данных[13], например, LD score regression[14] сопоставляет статистики неравновесия сцепления (доступные из публичных наборов данных, таких как 1000 Genomes) с публичными сводными эффектами для оценки наследуемости и генетических корреляций/перекрытий нескольких признаков. Broad Institute поддерживает LD Hub, предоставляющий публичный веб-интерфейс к >=177 признакам с LD score regression[15]. Другой метод по сводным данным — HESS[16]. - Доверительные интервалы могут быть некорректными, выходить за пределы диапазона 0–1 наследуемости и быть очень неточными из-за асимптотики[17].
- Занижение SNP-наследуемости: GCTA неявно предполагает, что все классы SNP — более редкие или более частые, новые или старые, более или менее в неравновесии сцепления — в среднем оказывают одинаковое влияние; у человека более редкие и новые варианты, как правило, имеют большие и более негативные эффекты[18], поскольку они отражают мутационную нагрузку, устраняемую отрицательным отбором. Как и при ошибках измерения, это будет смещать оценки GCTA в сторону занижения наследуемости.
Интерпретация
GCTA даёт несмещённую оценку общей дисперсии фенотипа, объясняемой всеми вариантами, включёнными в матрицу родства (и любой вариацией, коррелирующей с этими SNP). Эту оценку также можно интерпретировать как максимальную точность предсказания (R^2), которую можно достичь линейным предиктором, использующим все SNP в матрице родства. Последняя интерпретация особенно актуальна для разработки полигенных рисковых баллов, поскольку определяет их максимальную точность. Оценки GCTA иногда ошибочно интерпретируются как оценки общей (или узкосмысловой, то есть аддитивной) наследуемости, но это не гарантируется методом. Оценки GCTA также иногда ошибочно трактуются как «нижние границы» узкосмысловой наследуемости, но это тоже неверно: во-первых, потому что оценки GCTA могут быть смещены (в том числе вверх), если модельные предположения нарушены, а во-вторых, потому что по определению (и при выполнении модельных предположений) GCTA может дать несмещённую оценку узкосмысловой наследуемости, если все причинные варианты включены в матрицу родства. Интерпретация оценки GCTA относительно узкосмысловой наследуемости зависит от вариантов, использованных для построения матрицы родства.
Чаще всего GCTA проводится с одной матрицей родства, построенной по распространённым SNP, и не учитывает (или не полностью учитывает) вклад следующих факторов:
- Любые редкие или низкочастотные варианты, которые не были напрямую генотипированы/импутированы.
- Любые нелинейные, доминантные или эпистатические генетические эффекты. Следует отметить, что GCTA можно расширить для оценки вклада этих эффектов с помощью более сложных матриц родства.
- Эффекты взаимодействия генов и среды. Следует отметить, что GCTA можно расширить для оценки вклада GxE-взаимодействий, если E известна, путём включения дополнительных компонент дисперсии.
- Структурные варианты, которые обычно не генотипируются и не импутируются.
- Ошибки измерения: GCTA не моделирует неопределённость или ошибку в измеряемом признаке.
GCTA делает несколько модельных предположений и может давать смещённые оценки при следующих условиях:
- Распределение причинных вариантов систематически отличается от распределения вариантов, включённых в матрицу родства (даже если все причинные варианты включены в матрицу родства). Например, если причинные варианты систематически имеют более высокую/низкую частоту или более высокую/низкую корреляцию, чем все генотипированные варианты. Это может приводить как к завышению, так и к занижению оценок в зависимости от соотношения между причинными вариантами и используемыми вариантами. Для учёта этих сдвигов предложены различные расширения GCTA (например, GREML-LDMS).
- Стратификация популяции не полностью учтена ковариатами. GCTA (в частности, GREML) учитывает стратификацию путём включения ковариат с фиксированным эффектом, обычно главных компонент. Если эти ковариаты не полностью отражают стратификацию, оценка GCTA будет смещена, как правило, вверх. Учёт недавней популяционной структуры особенно сложен для исследований редких вариантов.
- Остаточная генетическая или средовая связанность в данных. GCTA предполагает однородную популяцию с независимым и одинаково распределённым средовым членом. Это предположение нарушается, если в данных присутствуют родственные индивиды и/или индивиды с существенно общей средой. В этом случае оценка GCTA дополнительно будет учитывать вклад любой генетической вариации, коррелирующей с генетическим родством: как прямые генетические эффекты, так и коррелирующую среду.
- Наличие «косвенных» генетических эффектов. Когда генетические варианты, присутствующие в матрице родства, коррелируют с вариантами у других индивидов, влияющими на среду участника, эти эффекты также будут учтены в оценке GCTA. Например, если варианты, унаследованные участником от матери, влияют на его фенотип через материнскую среду, то эффект этих вариантов будет включён в оценку GCTA, даже если он «косвенный» (то есть опосредован родительской генетикой). Это может трактоваться как завышение, поскольку такие «косвенные» эффекты не являются строго причинными (изменение их у участника не приведёт к ожидаемому изменению фенотипа).
Реализации
Оригинальный программный пакет «GCTA» является наиболее широко используемым; его основная функциональность охватывает оценку SNP-наследуемости методом GREML, но включает и другие возможности:
- Оценка генетического родства по всему геному на основе SNP;
- Оценка коэффициента инбридинга по всему геному на основе SNP;
- Оценка дисперсии, объясняемой всеми аутосомными SNP;
- Разделение генетической дисперсии по отдельным хромосомам;
- Оценка генетической дисперсии, связанной с X-хромосомой;
- Тестирование эффекта компенсации дозы на генетическую дисперсию по X-хромосоме;
- Прогнозирование аддитивных генетических эффектов по всему геному для отдельных субъектов и отдельных SNP;
- Оценка структуры LD для списка целевых SNP;
- Моделирование данных GWAS на основе наблюдаемых генотипов;
- Конвертация исходных генотипов Illumina в формат PLINK;
- Условный и совместный анализ сводных статистик GWAS без индивидуальных генотипов
- Оценка генетической корреляции между двумя признаками (заболеваниями) по данным SNP
- Анализ ассоциаций с помощью смешанных линейных моделейGCTA, cnsgenomics.com/software/gcta/
Другие реализации и варианты алгоритмов включают:
- FAST-LMM[20]
- FAST-LMM-Select:[21] как и GCTA, использует ридж-регрессию[22], но включает отбор признаков для исключения нерелевантных SNP, которые только добавляют шум в оценки родства
- LMM-Lasso[23]
- GEMMA[24]
- EMMAX[25]
- REACTA (ранее ACTA) заявляет о сокращении времени работы на порядок[26][27]
- BOLT-REML/BOLT-LMM[28], быстрее и лучше масштабируется[29]; с потенциально большей эффективностью в сценарии мета-анализа[30]
- MEGHA[31]
- PLINK >1.9 (декабрь 2013) поддерживает «использование матриц генетического родства в анализе ассоциаций с помощью смешанных моделей и других вычислениях»
- LDAK:[32] ослабляет предположение GCTA о том, что все SNP, независимо от качества генотипирования или частоты, имеют одинаковый ожидаемый эффект, что позволяет потенциально находить гораздо больше SNP-наследуемости
- GREML-IBD:[33] GCTA для идентичности по происхождению, пытается оценить наследуемость на основе общих сегментов генома у отдалённых неродственных родственников, чтобы учесть эффект более редких вариантов, не измеряемых SNP-панелями или неимпутируемых
См. также
Примечания
Литература
- «Research review: Polygenic methods and their application to psychiatric traits», Wray и др. 2014
- «Heritability in the genomics era — concepts and misconceptions» Архивировано 22 мая 2016 года., Visscher и др. 2008
- «Uncovering the Genetic Architectures of Quantitative Traits», Lee и др. 2016
- «Estimating heritability using genomic data», Stanton-Geddes и др. 2013
- «MultiBLUP: improved SNP-based prediction for complex traits», Speed & Balding 2012
- «Advantages and pitfalls in the application of mixed-model association methods», Yang и др. 2013
- «Prediction of Total Genetic Value Using Genome-Wide Dense Marker Maps», Meuwissen и др. 2001
- «Understanding and using quantitative genetic variation», Hill 2009
- «One Hundred Years of Statistical Developments in Animal Breeding», Gianola & Rosa 2015
- «Conditions for the validity of SNP-based heritability estimation», Lee & Chow 2014
- «Measuring missing heritability: Inferring the contribution of common variants», Golan и др. 2014
- «Concepts, estimation and interpretation of SNP-based heritability», Yang и др. 2017
- Maier и др. 2017, «Embracing polygenicity: a review of methods and tools for psychiatric genetics research»
- Ronald & Pain 2018, «A systematic review of genome-wide research on psychotic experiences and negative symptom traits: new revelations and implications for psychiatry»