Головна▸Статті▸Біологія

Інструменти біоінформатики та геномні труби

Обчислювальні підходи до аналізу біологічних даних від геномів до окремих клітин

mysimulator teamОновлено — червень 2026≈ 8 хв читання▶ Відкрити симуляцію

Вступ до біоінформатики

Біоінформатика – це дисципліна, яка застосовує обчислювальні методи для зберігання, пошуку, аналізу та інтерпретації великих масштабів біологічних даних – особливо послідовностей нуклеотидів, структури білків та геномної інформації. Ця дисципліна виникла внаслідок потреби обробляти дані, що генеруються секвенуванням ДНК: перший запис у GenBank (1982) містив 606 основ; наразі (2024) GenBank містить понад 2,5 трильйона пар основ. Сучасне цілогеномне секвенування генерує 30× покриття 3,2-гігабазного людського геному за кілька годин, створюючи сотні гігабайтів на зразок, які потребують складних обчислювальних конвеєрів для контролю якості, вирівнювання послідовностей, виявлення варіантів та функціональної аннотації перед клінічним або науковим аналізом.

Основні бази даних, що структурують біологічні знання, включають NCBI (послідовності GenBank, література PubMed, варіанти dbSNP, варіанти ClinVar), Ensembl (аназовані геномні збірки), UniProt (послідовності та функції білків), PDB (Protein Data Bank – 3D структури білків і нуклеїнових кислот), KEGG (метаболічні шляхи) та Gene Ontology (стандартизована аннотація функцій генів). Принципи FAIR (Findable, Accessible, Interoperable, Reusable) керують сучасним управлінням біологічними даними, забезпечуючи відтворюваність досліджень і мета-аналіз між дослідженнями та видами.

Послідовне вирівнювання та збірка геному

Вирівнювання коротких послідовностей

Секвенування Illumina виробляє мільйони коротких послідовностей (75-300 п.н.) які необхідно вирівняти до опорного геному. BWA-MEM2 та Bowtie2 використовують перетворення Брунова-Вейлера та структури індексів FM, що дозволяють майже точне вирівнювання понад 50 мільйонів послідовностей до геному людини обсягом 3,2 Гб протягом декількох хвилин. Вирівнювання генерує файли SAM/BAM, які містять положення послідовностей, оцінки якості та прапорки вирівнювання. STAR та HISAT2 є вирівнювачами з урахуванням сплайсингу – враховують послідовності, що проходять через місця переходу екзони-екзон. Після вирівнювання: samtools для сортування/індексації/фільтрації, Picard MarkDuplicates для зменшення упередження від дублікатів ПЦР, GATK BaseRecalibration для коригування систематичних помилок за положенням та контекстом нуклеотидів – кожен крок необхідний для точності виявлення варіантів в подальших аналізах. CIGAR-послідовності у файлах BAM кодують форму вирівнювання: збіги, видалення, вставки, м’які обрізи.

Збірка довгих послідовностей

Довгі послідовності PacBio (HiFi) та Oxford Nanopore (1-100+ кб) дозволяють охоплювати повторювані області, розрізняти структурні варіанти та фазувати хаплоти, які не можуть виявити короткі послідовності. De novo збірка геному з довгих послідовностей використовує збирачі на основі методу OLC: Hifiasm (PacBio HiFi), Flye (Nanopore) – будують графіки збірки шляхом пошуку перекриттів послідовностей та їх розв’язування в безперервні послідовності. T2T-CHM13 збірка геному людини (2022) додала понад 200 Мб раніше нерозрізненної послідовності, включаючи всі центромери, від кінців хромосом та сегментарні дуплікації – завершивши референсний геном людини за 20 років після першого проекту. Гібридна збірка, що поєднує короткі та довгі послідовності (полірування коротких послідовностей на основі довгої послідовності), досягає найвищої точності.

жива демонстрація · пов'язана симуляція● LIVE

Виклик варіантів та анотування

Виклик SNV та інделів

GATK HaplotypeCaller є стандартним інструментом для виявлення SNV та невеликих інделів у гемах: локальна де-ново збірка в активних областях з перепрофільованих зчитувань, за якою слідує обчислення статистичної ймовірності генотипу на основі позиційно-специфічних моделей, що дає VCF (формат виклику варіантів) файли з генотипами та показниками якості (GQ, DP, FILTER). VQSR використовує гауссову суміш, навчену на відомих базах даних варіантів, для класифікації варіантів як PASS або відфільтрованих. Виклик соматичних варіантів (з парних зразків пухлини та здорової тканини): GATK Mutect2 ідентифікує варіанти пухлини-специфічні за допомогою відповідного нормального зразка як фонового панелі нормальних гемах; CNVkit та FACETS визначають варіанти кількості копій. Стандартне порівняння точності наборах даних NIST/Genome in a Bottle дозволяє порівнювати виклики та валідувати продуктивність клінічної трубки. Аналіз RNA-seq: необроблені зчитування перевіряються на якість за допомогою FastQC; адаптери видаляються за допомогою Trimmomatic або Cutadapt; зчитування вирівнюються за допомогою STAR або псевдовирівнюються за допомогою Salmon/kallisto (кількісне визначення транскрипційних кількостей безпосередньо з зчитувань без вирівнювання); матриці рахунків генеруються за допомогою featureCounts або HTSeq-count; відмінності в експресії визначаються за допомогою DESeq2 або edgeR (моделі негайної біноміальної розподілу для даних з перебільшеним розсіюванням з нормалізацією, відповідною розміру вибірки); збагачення шляхів за допомогою fgsea або clusterProfiler. Вимірювання без вирівнювання (Salmon/kallisto) зменшує обчислювальний час у 100 разів з еквівалентною точністю. Інтеграція кількох зразків (видалення впливу партицій за допомогою ComBat або limma removeBatchEffect) є необхідною для метааналізу між дослідженнями. ENCODE та GTEx консорціуми надають посібники щодо експресії генів у тканинах та умовах.

Структурна біоінформатика

AlphaFold2 (DeepMind, 2021) прогнозує 3D структуру білка з первинної послідовності з майже експериментальною точністю, використовуючи особливості багатосекційного вирівнювання послідовностей та механізми уваги на основі глибокого навчання — вирішуючи 50-річну наукову задачу в обчислювальній біології. База даних структур білків AlphaFold тепер містить прогнози для практично всіх ~200 мільйонів відомих білків. AlphaFold-Multimer розширює прогнози до білкових комплексів; AlphaFold3 (2024) прогнозує структури білків з ДНК, РНК та малими молекулярними лігандами. Rosetta ab initio передбачення структури, динаміка молекул (GROMACS, AMBER, NAMD) та молекулярне докінгування (AutoDock, Glide) доповнюють експериментальні структури у відкритті ліків для ідентифікації зв’язних карманів, оптимізації лідів та розуміння взаємодій білок-лікарський засіб.

Приклади та застосування

Приклад 1: Клінічне послідовне секвенування цілого екзома

Клінічне WES для діагностики рідкісних захворювань: Якість ДНК → підготовка бібліотек → захоплення екзому (Agilent SureSelect, IDT xGen) → секвенування Illumina → вирівнювання BWA-MEM → обчислення гетерозиготних варіантів за допомогою GATK HaplotypeCaller → функціональне анотування VEP/ANNOVAR → фільтрація на основі MAF (невеликої алелевої частоти нижче 0,01 у gnomAD), передбачуваної патогенності (оцінка CADD >20), списків генів захворювань (OMIM, ClinVar патогенні) → аналіз трио (одночасне секвенування батьків дозволяє ідентифікувати де ново варіанти) → генерація звітів для клінічної інтерпретації. Середній діагностичний вихід 25-35% для недіагностованих генетичних захворювань, досягаючи 40-50%, коли відбувається точна характеристика фенотипу. Випадки, які не вирішуються після WES, можуть бути переглянуті за допомогою секвенування цілого геному, виявляючи не-кодуючі варіанти, структурні варіації та розширення повторів, які були пропущені в екзомі.

Приклад 2: Геномно-асоційовані дослідження (GWAS) біоінформатики

Дослідження GWAS з використанням геномно-широкомасштабних асоціаційних досліджень перевіряють мільйони SNP на зв'язок із фенотипом серед сотень тисяч людей. Контроль якості конвеєра: дані масиву гентипування → контроль якості зразків (коефіцієнт виклику, перевірка статі, видалення викидів) → контроль якості SNP (MAF-фільтр, відхилення HWE, коефіцієнт виклику) → PCA за кластерами популяцій → імплементація (панель Haplotype reference consortium з 700 тисяч SNP масиву до ~10 мільйонів передбачених варіантів) → тест на асоціацію (PLINK2 логістична/лінійна регресія, включаючи ПК як коваріати) → метааналіз кількох когортів (METAL) → злиття LD для ідентифікації незалежних сигналів асоціації → уточнення картину за допомогою сутєвих методів (SuSiE, FINEMAP polyfine) для пріоритетності варіантів причинності → колокалізація з eQTL для виявлення ймовірних генів-причин.

Приклад 3: Потік даних одноклітинної РНК-секвенування

Біоінформатика одноклітинного РНК-секвенування: необроблені читання демультиплексуються та кількість визначається з використанням Cell Ranger або STARsolo (мапують читання до бітокодів клітин і UMIs) → фільтрація якості (видалення порожніх крапель, мертвих клітин з високим вмістом мітохондріальних генів) → нормалізація (scran pooling або sctransform) → зменшення розмірності (PCA → UMAP або tSNE) → кластеризація (Seurat Louvain, Scanpy Leiden) → анотування типів клітин (вираження маркерних генів, перенесення даних з посиланням на довідковий набір за допомогою SingleR або Seurat label transfer) → виразна різниця між умовами (pseudobulk з DESeq2, враховуючи окремі зразки як біологічні репліки) → аналіз траєкторій (pseudotime: Monocle3, scVelo RNA velocity) для визначення розвитку лінійних відносин та зв'язків між клітинами на основі транскрипційних даних.

Приклад 4: Метагеномний аналіз

Аналіз метагеному збірів зразків мікробіоми: необроблені читання деконтаминуються від гостя (bowtie2 мапування до геному гостя, видалення людських генів) → класифікація видів за допомогою к-мерного класифікатора Kraken2 проти оновленої бази даних NCBI, Metaphlan3 за допомогою кладових маркерних генів для профілювання відносної кількості) → функціональне профілювання (HUMAnN3 мапування до сімейств білків UniRef90) → де ново збірка (MEGAHIT, metaSPAdes) → розділення зібраних контигів на бін-одиниці за допомогою покриття + тетрануклеотидний склад (MetaBat2, MaxBin2) → оцінка якості бінів (CheckM оцінює завершеність та забруднення за допомогою однокопійних маркерних генів) → таксономічна класифікація бінів (GTDB-Tk) → метагенозбірки геному (MAGs) для відкриття нових видів некультивованих мікроорганізмів.

Приклад 5: Аналіз ChIP-seq та ATAC-seq

ChIP-seq ідентифікує геномно-широкомасштабні білкові зв'язуючі місця: хроматична індукція змушує ДНК, пов’язану з цільовим білком, збагачуватися; читання вирівнюються до посилань на геном; піки викликають за допомогою MACS2 (модельний аналіз з локальним нормалізаційним фоновим шумом); піки класифікуються найближчими генами (ChIPseeker); мотивний аналіз ідентифікує збагачені транскрипційні фактори білкові зв’язуючі мотиви в піках (HOMER, MEME-ChIP). ATAC-seq ідентифікує відкритий хроматин (доступні регуляторні елементи): транспортер Tn5 тегує фрагментацію адаптерами послідовностей переважно в відкритому хроматині; читання зменшують мітохондріальні читання; MACS2 пік-викликання в мононуклеосомових позиціях (<150 bp) та монусомових позиціях; аналіз відмінності доступності між зразками/умовами виявляє регуляторні елементи, які активуються або приглушуються. Інтеграція даних ChIP-seq, ATAC-seq, РНК-seq та Hi-C створює транскрипційні регуляторні мережі.

Приклад 6: Філогенетичні аналізи конвеєрів

Молекулярна філогенетика будує еволюційні дерева на основі послідовних даних. Потік для вивчення вірусів/бактерій (наприклад, відстеження лінії SARS-CoV-2) включає збірку геному → вирівнювання MAFFT багатопотокових послідовностей → обрізання артефактів вирівнювання → IQ-TREE2 або FastTree максимальної ймовірності побудови філогенетичного дерева (модель GTR+G для відбору заміни) → часове масштабування за допомогою Bayesian phylogenetic inference (BEAST2 з TempEst root-to-tip regression підтверджує сигнал годинника) → класифікація ліній (Nextclade, Pangolin для номенклатури SARS-CoV-2) → реконструкція предків та аналіз просторового розповсюдження (TreeTime, BEAST discrete phylogeography). Реальний час вивчення вірусів SARS-CoV-2 (Nextstrain) згенерував один із найбільш детальних наборів даних для філогенетичного моніторингу пандемії в історії, відстежуючи >10 мільйонів послідовно секвенуваних геномів.

Приклад 7: Машинне навчання в біоінформатиці

Машинне навчання та глибоке навчання трансформують біоінформатику: DeepVariant використовує згорткові нейронні мережі (CNN) на зображеннях нагромадження читань для виявлення SNP/інтервалів з більшою точністю, ніж GATK у важких областях. scVI та Scanorama використовують варіаційні автокодувальники для інтеграції даних одноклітинних клітин між партіями. Мовні моделі білків (ESM-1b, ESM-2, ProTrans) навчаються на еволюційних обмеженнях з мільйонів послідовностей — що дозволяє прогнозувати вплив мутацій (прогнозування пристосованості без залучення), проектування білків та передбачення структури (ESMFold). Графові нейронні мережі на молекулярних графах прогнозують взаємодію між лікарськими засобами та цілями, ADMET властивості та токсичність молекул. Інструменти Bedtools, deeptools та gkmSVM використовують SVM для передбачення геномних ознак. Федеральне навчання дозволяє багатоцентровому навчанню моделей на приватних клінічних даних геному без обміну необробленими даними.

Спробуйте онлайн

Все вище працює у вашому браузері – відкрийте «Геометричне поле бою» та змініть параметри під час роботи. Не встановлюється нічого, не завантажується нічого, весь модель жив у одному вікні.

Спробуйте наживо

Усе, що вище, працює прямо у вашому браузері — відкрийте Sequence Alignment DP Landscape і змінюйте параметри під час роботи. Нічого не встановлюється, нічого не завантажується на сервер, уся модель живе в одній вкладці.

▶ Відкрити симуляцію Sequence Alignment DP Landscape

Що ви знайшли?

Додати кроки відтворення (опційно)