Геномный анализ сложных признаков

Геномный анализ сложных признаков (англ. Genome-wide complex trait analysis, GCTA), также геномный метод оценки ограниченного максимального правдоподобия (англ. Genome-based restricted maximum likelihood, GREML) — это статистический метод оценки наследуемости в генетике, который количественно определяет общий аддитивный вклад набора генетических вариантов в признак. GCTA обычно применяется к распространённым однонуклеотидным полиморфизмам (SNP) на генотипирующем чипе и поэтому называется «чиповой» или «SNP-наследуемостью».

GCTA работает путём прямого количественного определения случайного генетического сходства неродственных индивидов и сравнения его с их измеренным сходством по признаку; если два неродственных индивида относительно схожи генетически и также имеют схожие значения признака, то измеренная генетика, вероятно, причинно влияет на этот признак, и корреляция может в определённой степени показать, насколько сильно. Это можно проиллюстрировать построением графика квадратов попарных различий признака между индивидами в зависимости от их оценённой степени родства[1]. GCTA делает ряд модельных предположений, и вопрос о том, когда эти предположения выполняются, остаётся предметом обсуждения.

Фреймворк GCTA был также расширен по ряду направлений: количественная оценка вклада различных категорий SNP (то есть функциональное разбиение); оценка вклада взаимодействий генов и среды; оценка вклада неаддитивных/нелинейных эффектов SNP; а также бивариантный анализ нескольких фенотипов для оценки их генетической ковариации (совместная наследуемость или генетическая корреляция).

Оценки GCTA имеют значение для потенциала открытий в геномных ассоциативных исследованиях (GWAS) и для проектирования и точности полигенных баллов. Оценки GCTA по распространённым вариантам обычно существенно ниже других оценок общей или узкосмысловой наследуемости (например, по близнецовым или родственным исследованиям), что способствовало дискуссии о проблеме недостающей наследуемости.

Общие сведения
GCTA
Автор Ян Ян
Первый выпуск 30 августа 2010
Последняя версия 1.26.0 (2016-06-22[19])
Лицензия GPL v3 (исходный код)
MIT (исполняемые файлы)[19]
Сайт cnsgenomics.com/software/gcta/

История

Оценка в биологии/животноводстве с использованием стандартных методов ANOVA/REML для компонентов дисперсии, таких как наследуемость, общий вклад среды, материнские эффекты и др., обычно требует индивидов с известной степенью родства, например, родитель/потомок; это часто недоступно или данные о родословной ненадёжны, что приводит к невозможности применения методов или требует строгого лабораторного контроля всего разведения (что угрожает внешней валидности всех оценок). Несколько авторов отмечали, что степень родства можно измерять напрямую по генетическим маркёрам (и если индивиды достаточно связаны, экономически достаточно получить немного маркёров для статистической мощности), что привело Кермита Ритланда в 1996 году к предложению напрямую сравнивать попарную степень родства с попарными фенотипическими измерениями (Ritland 1996, «A Marker-based Method for Inferences About Quantitative Inheritance in Natural Populations» [2]).

С резким снижением стоимости секвенирования генома в 2000-х годах стало возможным получение достаточного количества маркёров у достаточного числа субъектов для надёжных оценок с использованием очень отдалённо родственных индивидов. Раннее применение метода к человеку было осуществлено в работах Visscher и др. 2006[3]/2007[4], где использовались SNP-маркёры для оценки фактической степени родства между сиблингами и оценки наследуемости по прямым генетическим данным. У человека, в отличие от исходных животных/растительных приложений, степень родства обычно известна с высокой точностью в «дикой популяции», и преимущество GCTA связано скорее с избеганием предположений классических дизайнов поведенческой генетики и верификацией их результатов, а также с разбиением наследуемости по классам SNP и хромосомам. Первое применение GCTA к человеку было опубликовано в 2010 году, показав, что 45 % дисперсии роста человека может быть объяснено включёнными SNP[5][6]. (Крупные GWAS по росту с тех пор подтвердили эту оценку[7].) Алгоритм GCTA был затем описан, а программная реализация опубликована в 2011 году[8]. С тех пор он используется для изучения широкого спектра биологических, медицинских, психиатрических и психологических признаков у человека и вдохновил множество вариантов подхода.

Преимущества

Надёжная наследуемость

Близнецовые и семейные исследования давно используются для оценки доли дисперсии, объясняемой определёнными категориями генетических и средовых причин. Для широкого спектра изученных человеческих признаков обычно наблюдается минимальное влияние общей среды, значительное влияние неразделяемой среды и крупный генетический компонент (в основном аддитивный), который в среднем составляет около 50 % и иногда значительно выше для некоторых признаков, таких как рост или интеллект[9]. Однако близнецовые и семейные исследования подвергаются критике за опору на ряд предположений, которые трудно или невозможно проверить, таких как предположение о равенстве сред (что среды монозиготных и дизиготных близнецов одинаково схожи), отсутствие ошибочной классификации зиготности (ошибочное принятие идентичных за разнояйцевых и наоборот), что близнецы не являются репрезентативными для общей популяции, и отсутствие ассортативного скрещивания. Нарушения этих предположений могут приводить как к завышению, так и к занижению оценок параметров[10]. (Дебаты и критика особенно касаются наследуемости интеллекта.)

Использование данных SNP или всего генома от неродственных участников (слишком родственные участники, обычно >0,025 или ~уровень четвероюродных братьев/сестёр, исключаются, а несколько главных компонент включаются в регрессию для предотвращения и контроля стратификации популяции) позволяет обойти многие проблемы наследуемости: близнецы часто вообще не участвуют, нет вопросов о равном обращении, степень родства оценивается точно, а выборки набираются из широкого круга субъектов.

В дополнение к большей устойчивости к нарушениям предположений близнецовых исследований, данные SNP могут быть проще в сборе, поскольку не требуют редких близнецов, и, следовательно, наследуемость редких признаков также может быть оценена (с учётом коррекции на смещённость отбора).

Мощность GWAS

Оценки GCTA могут быть использованы для разрешения проблемы недостающей наследуемости и планирования GWAS, которые дадут статистически значимые результаты на уровне всего генома. Это достигается путём сравнения оценки GCTA с результатами меньших GWAS. Если GWAS с n=10 000 по данным SNP не даёт ни одного результата, но GCTA указывает на высокую наследуемость, объясняемую SNP, это подразумевает, что вовлечено большое количество вариантов (полигенность), и, следовательно, для точной оценки эффекта каждого SNP и прямого учёта части наследуемости GCTA потребуются гораздо более крупные GWAS.

Недостатки

  1. Ограниченность выводов: оценки GCTA по своей природе ограничены тем, что не могут оценивать широкосмысловую наследуемость, как близнецовые/семейные исследования, поскольку оценивают только наследуемость, обусловленную SNP. Поэтому, хотя они служат критическим тестом на отсутствие смещения в близнецовых/семейных исследованиях, GCTA не может их заменить для оценки общего генетического вклада в признак.
  2. Существенные требования к данным: число SNP, генотипированных на человека, должно быть в тысячах, а желательно — в сотнях тысяч для разумных оценок генетического сходства (хотя сейчас это не проблема для современных коммерческих чипов, которые по умолчанию содержат сотни тысяч или миллионы маркёров); а число людей для относительно стабильных оценок SNP-наследуемости должно быть не менее n>1000, а желательно n>10000[11]. В отличие от этого, близнецовые исследования могут давать точные оценки при гораздо меньших выборках.
  3. Вычислительная неэффективность: исходная реализация GCTA плохо масштабируется с увеличением объёма данных (), поэтому даже если данных достаточно для точных оценок GCTA, вычислительная нагрузка может быть чрезмерной. GCTA может быть мета-анализирована как стандартный мета-анализ с фиксированным эффектом и взвешиванием по точности[12], поэтому исследовательские группы иногда оценивают когорты или подвыборки и затем объединяют их мета-аналитически (ценой дополнительной сложности и некоторой потери точности). Это мотивировало создание более быстрых реализаций и вариантов алгоритмов с иными предположениями, например, с использованием метода моментов.
  4. Необходимость исходных данных: GCTA требует генетического сходства всех субъектов, а значит, их исходной генетической информации; из-за соображений конфиденциальности индивидуальные данные редко доступны. GCTA нельзя запустить по сводным статистикам, публикуемым многими проектами GWAS, и если объединять несколько оценок GCTA, требуется мета-анализ.
    В отличие от этого, существуют альтернативные методы, работающие по сводным данным GWAS без необходимости исходных данных[13], например, LD score regression[14] сопоставляет статистики неравновесия сцепления (доступные из публичных наборов данных, таких как 1000 Genomes) с публичными сводными эффектами для оценки наследуемости и генетических корреляций/перекрытий нескольких признаков. Broad Institute поддерживает LD Hub, предоставляющий публичный веб-интерфейс к >=177 признакам с LD score regression[15]. Другой метод по сводным данным — HESS[16].
  5. Доверительные интервалы могут быть некорректными, выходить за пределы диапазона 0–1 наследуемости и быть очень неточными из-за асимптотики[17].
  6. Занижение SNP-наследуемости: GCTA неявно предполагает, что все классы SNP — более редкие или более частые, новые или старые, более или менее в неравновесии сцепления — в среднем оказывают одинаковое влияние; у человека более редкие и новые варианты, как правило, имеют большие и более негативные эффекты[18], поскольку они отражают мутационную нагрузку, устраняемую отрицательным отбором. Как и при ошибках измерения, это будет смещать оценки GCTA в сторону занижения наследуемости.

Интерпретация

GCTA даёт несмещённую оценку общей дисперсии фенотипа, объясняемой всеми вариантами, включёнными в матрицу родства (и любой вариацией, коррелирующей с этими SNP). Эту оценку также можно интерпретировать как максимальную точность предсказания (R^2), которую можно достичь линейным предиктором, использующим все SNP в матрице родства. Последняя интерпретация особенно актуальна для разработки полигенных рисковых баллов, поскольку определяет их максимальную точность. Оценки GCTA иногда ошибочно интерпретируются как оценки общей (или узкосмысловой, то есть аддитивной) наследуемости, но это не гарантируется методом. Оценки GCTA также иногда ошибочно трактуются как «нижние границы» узкосмысловой наследуемости, но это тоже неверно: во-первых, потому что оценки GCTA могут быть смещены (в том числе вверх), если модельные предположения нарушены, а во-вторых, потому что по определению (и при выполнении модельных предположений) GCTA может дать несмещённую оценку узкосмысловой наследуемости, если все причинные варианты включены в матрицу родства. Интерпретация оценки GCTA относительно узкосмысловой наследуемости зависит от вариантов, использованных для построения матрицы родства.

Чаще всего GCTA проводится с одной матрицей родства, построенной по распространённым SNP, и не учитывает (или не полностью учитывает) вклад следующих факторов:

  1. Любые редкие или низкочастотные варианты, которые не были напрямую генотипированы/импутированы.
  2. Любые нелинейные, доминантные или эпистатические генетические эффекты. Следует отметить, что GCTA можно расширить для оценки вклада этих эффектов с помощью более сложных матриц родства.
  3. Эффекты взаимодействия генов и среды. Следует отметить, что GCTA можно расширить для оценки вклада GxE-взаимодействий, если E известна, путём включения дополнительных компонент дисперсии.
  4. Структурные варианты, которые обычно не генотипируются и не импутируются.
  5. Ошибки измерения: GCTA не моделирует неопределённость или ошибку в измеряемом признаке.

GCTA делает несколько модельных предположений и может давать смещённые оценки при следующих условиях:

  1. Распределение причинных вариантов систематически отличается от распределения вариантов, включённых в матрицу родства (даже если все причинные варианты включены в матрицу родства). Например, если причинные варианты систематически имеют более высокую/низкую частоту или более высокую/низкую корреляцию, чем все генотипированные варианты. Это может приводить как к завышению, так и к занижению оценок в зависимости от соотношения между причинными вариантами и используемыми вариантами. Для учёта этих сдвигов предложены различные расширения GCTA (например, GREML-LDMS).
  2. Стратификация популяции не полностью учтена ковариатами. GCTA (в частности, GREML) учитывает стратификацию путём включения ковариат с фиксированным эффектом, обычно главных компонент. Если эти ковариаты не полностью отражают стратификацию, оценка GCTA будет смещена, как правило, вверх. Учёт недавней популяционной структуры особенно сложен для исследований редких вариантов.
  3. Остаточная генетическая или средовая связанность в данных. GCTA предполагает однородную популяцию с независимым и одинаково распределённым средовым членом. Это предположение нарушается, если в данных присутствуют родственные индивиды и/или индивиды с существенно общей средой. В этом случае оценка GCTA дополнительно будет учитывать вклад любой генетической вариации, коррелирующей с генетическим родством: как прямые генетические эффекты, так и коррелирующую среду.
  4. Наличие «косвенных» генетических эффектов. Когда генетические варианты, присутствующие в матрице родства, коррелируют с вариантами у других индивидов, влияющими на среду участника, эти эффекты также будут учтены в оценке GCTA. Например, если варианты, унаследованные участником от матери, влияют на его фенотип через материнскую среду, то эффект этих вариантов будет включён в оценку GCTA, даже если он «косвенный» (то есть опосредован родительской генетикой). Это может трактоваться как завышение, поскольку такие «косвенные» эффекты не являются строго причинными (изменение их у участника не приведёт к ожидаемому изменению фенотипа).

Реализации

Оригинальный программный пакет «GCTA» является наиболее широко используемым; его основная функциональность охватывает оценку SNP-наследуемости методом GREML, но включает и другие возможности:

  • Оценка генетического родства по всему геному на основе SNP;
  • Оценка коэффициента инбридинга по всему геному на основе SNP;
  • Оценка дисперсии, объясняемой всеми аутосомными SNP;
  • Разделение генетической дисперсии по отдельным хромосомам;
  • Оценка генетической дисперсии, связанной с X-хромосомой;
  • Тестирование эффекта компенсации дозы на генетическую дисперсию по X-хромосоме;
  • Прогнозирование аддитивных генетических эффектов по всему геному для отдельных субъектов и отдельных SNP;
  • Оценка структуры LD для списка целевых SNP;
  • Моделирование данных GWAS на основе наблюдаемых генотипов;
  • Конвертация исходных генотипов Illumina в формат PLINK;
  • Условный и совместный анализ сводных статистик GWAS без индивидуальных генотипов
  • Оценка генетической корреляции между двумя признаками (заболеваниями) по данным SNP
  • Анализ ассоциаций с помощью смешанных линейных моделейGCTA, cnsgenomics.com/software/gcta/

Другие реализации и варианты алгоритмов включают:

  • FAST-LMM[20]
  • FAST-LMM-Select:[21] как и GCTA, использует ридж-регрессию[22], но включает отбор признаков для исключения нерелевантных SNP, которые только добавляют шум в оценки родства
  • LMM-Lasso[23]
  • GEMMA[24]
  • EMMAX[25]
  • REACTA (ранее ACTA) заявляет о сокращении времени работы на порядок[26][27]
  • BOLT-REML/BOLT-LMM[28], быстрее и лучше масштабируется[29]; с потенциально большей эффективностью в сценарии мета-анализа[30]
  • MEGHA[31]
  • PLINK >1.9 (декабрь 2013) поддерживает «использование матриц генетического родства в анализе ассоциаций с помощью смешанных моделей и других вычислениях»
  • LDAK:[32] ослабляет предположение GCTA о том, что все SNP, независимо от качества генотипирования или частоты, имеют одинаковый ожидаемый эффект, что позволяет потенциально находить гораздо больше SNP-наследуемости
  • GREML-IBD:[33] GCTA для идентичности по происхождению, пытается оценить наследуемость на основе общих сегментов генома у отдалённых неродственных родственников, чтобы учесть эффект более редких вариантов, не измеряемых SNP-панелями или неимпутируемых

См. также

Примечания

  1. Рисунок 3 в Yang et al 2010, или рисунок 3 в Ritland & Ritland 1996
  2. см. также Ritland 1996b, «Estimators for pairwise relatedness and individual inbreeding coefficients» Архивировано 16 января 2017 года.; Ritland & Ritland 1996, «Inferences about quantitative inheritance based on natural population structure in the yellow monkeyflower, Mimulus guttatus» Архивировано 24 сентября 2016 года.; Lynch & Ritland 1999, «Estimation of Pairwise Relatedness With Molecular Markers»; Ritland 2000, «Marker-inferred relatedness as a tool for detecting heritability in nature» Архивировано 25 сентября 2016 года.; Thomas 2005, «The estimation of genetic relationships using molecular markers and their efficiency in estimating heritability in natural populations»
  3. Visscher и др. 2006, «Assumption-free estimation of heritability from genome-wide identity-by-descent sharing between full siblings»
  4. Visscher и др. 2007, «Genome partitioning of genetic variation for height from 11,214 sibling pairs»
  5. «Common SNPs explain a large proportion of heritability for human height», Yang и др. 2010
  6. «A Commentary on ‘Common SNPs Explain a Large Proportion of the Heritability for Human Height’ by Yang et al. (2010)», Visscher и др. 2010
  7. «Defining the role of common variation in the genomic and biological architecture of adult human height», Wood и др. 2014
  8. «GCTA: A Tool for Genome-wide Complex Trait Analysis», Yang и др. 2011
  9. «Meta-analysis of the heritability of human traits based on fifty years of twin studies», Polderman и др. 2015
  10. Barnes, J. C., Wright, John Paul, Boutwell, Brian B., Schwartz, Joseph A., Connolly, Eric J., Nedelec, Joseph L., Beaver, Kevin M. (2014-11-01). “Demonstrating the Validity of Twin Research in Criminology”. Criminology [англ.]. 52 (4): 588—626. DOI:10.1111/1745-9125.12049. ISSN 1745-9125.
  11. «GCTA в конечном итоге обеспечит прямые ДНК-тесты количественных генетических результатов, основанных на близнецовых и приёмных исследованиях. Одна из проблем — для надёжных оценок требуется много тысяч индивидов. Другая проблема — нужно больше SNP, чем даже миллион SNP на современных микрочипах, поскольку существует много вариаций ДНК, не захваченных этими SNP. В результате GCTA не может оценить всю наследуемость, возможно, только около половины наследуемости. Первые отчёты об анализах GCTA оценивают наследуемость примерно в половину оценок по близнецовым и приёмным исследованиям для роста (Lee, Wray, Goddard, & Visscher, 2011; Yang et al., 2010; Yang, Manolio, et al" 2011), и интеллекта (Davies et al., 2011).» стр. 110, Behavioral Genetics, Plomin и др. 2012
  12. «Meta-analysis of GREML results from multiple cohorts», Yang 2015
  13. Pasaniuc & Price 2016, «Dissecting the genetics of complex traits using summary association statistics»
  14. Bulik-Sullivan, B. K.; Loh, P. R.; Finucane, H.; Ripke, S.; Yang, J.; Schizophrenia Working Group of the Psychiatric Genomics Consortium; Patterson, N.; Daly, M. J.; Price, A. L.; Neale, B. M. (2015). “LD Score Regression Distinguishes Confounding from Polygenicity in Genome-Wide Association Studies”. Nature Genetics. 47 (3): 291—295. DOI:10.1038/ng.3211. PMC 4495769.
  15. «LD Hub: a centralized database and web interface to LD score regression that maximizes the potential of summary level GWAS data for SNP heritability and genetic correlation analysis», Zheng и др. 2016
  16. «Contrasting the genetic architecture of 30 complex traits from summary association data», Shi и др. 2016
  17. Schweiger, Regev; Kaufman, Shachar; Laaksonen, Reijo; Kleber, Marcus E.; März, Winfried; Eskin, Eleazar; Rosset, Saharon; Halperin, Eran (2016-06-02). “Fast and Accurate Construction of Confidence Intervals for Heritability”. The American Journal of Human Genetics. 98 (6): 1181—1192. DOI:10.1016/j.ajhg.2016.04.016.
  18. «Linkage disequilibrium–dependent architecture of human complex traits shows action of negative selection», Gazal и др. 2017
  19. 1 2 3 4 5 GCTA document. cnsgenomics.com. Дата обращения: 8 апреля 2021.
  20. «Fast linear mixed models for genome-wide association studies», Lippert 2011
  21. «Improved linear mixed models for genome-wide association studies», Listgarten и др. 2012
  22. «Advantages and pitfalls in the application of mixed-model association methods», Yang и др. 2014
  23. «A lasso multi-marker mixed model for association mapping with population structure correction», Rakitsch и др. 2012
  24. «Genome-wide efficient mixed-model analysis for association studies», Zhou & Stephens 2012
  25. «Variance component model to account for sample structure in genome-wide association studies», Kang и др. 2012
  26. «Advanced Complex Trait Analysis», Gray и др. 2012
  27. «Regional Heritability Advanced Complex Trait Analysis for GPU and Traditional Parallel Architecture», Cebamanos и др. 2012
  28. «Efficient Bayesian mixed model analysis increases association power in large cohorts», Loh и др. 2012
  29. «Contrasting genetic architectures of schizophrenia and other complex diseases using fast variance-components analysis», Loh и др. 2015; см. также «Contrasting regional architectures of schizophrenia and other complex diseases using fast variance components analysis», Loh и др. 2015
  30. «Mixed Models for Meta-Analysis and Sequencing», Bulik-Sullivan 2015
  31. «Massively expedited genome-wide heritability analysis (MEGHA)», Ge и др. 2015
  32. Speed и др. 2016, «Re-evaluation of SNP heritability in complex human traits»
  33. Evans и др. 2017, «Narrow-sense heritability estimation of complex traits using identity-by-descent information.»