Strona główna▸Artykuły▸Biologia

Narzędzia bioinformatyczne i pipeline genomiki

Obliczeniowe podejście do analizy danych biologicznych od genomów po pojedyncze komórki

mysimulator teamZaktualizowano — czerwiec 2026≈ 8 min czytania▶ Otwórz symulację

Wprowadzenie do bioinformatyki

Bioinformatyka to dziedzina stosująca metody obliczeniowe do przechowywania, odzyskiwania, analizowania i interpretowania dużych ilości danych biologicznych — szczególnie danych sekwencyjnych, struktur proteinowych oraz informacji genomicznych. Ta dziedzina wyrosła z potrzeby zarządzania danymi generowanymi przez sekwasjonowanie DNA: pierwsze przesłanie do GenBanka (1982) zawierało 606 base-pairów; do 2024 roku genetyczna baza danych GenBank zawiera ponad 2,5 triliona base-pairów. Nowoczesne sekwencjonowanie genomu całkowitego generuje 30-krotną pokrywę 3,2 gigabazowego genomu człowieka w godzinach, tworząc setki gigabajtów na próbkę, które wymagają zaawansowanych pipeline’ów obliczeniowych do kontroli jakości, aligamentowania czytaczy, wywoływania mutacji i anotacji funkcjonalnej przed kliniczną lub badawczą interpretacją.

Kluczowe bazy danych strukturyzujące wiedzę biologiczną obejmują NCBI (sekwencje GenBanka, literatura PubMed, zmiany dbSNP, anotacje clinVar), Ensembl (anotowane zestawy genomu), UniProt (sekwencje i funkcje protein), PDB (Protein Data Bank — struktury trójwymiarowe proteinowych i nukleinowych cząsteczek), KEGG (ścieżki metaboliczne) oraz Gene Ontology (standardowe anotacje funkcji genów). Dziedzina FAIR (Findable, Accessible, Interoperable, Reusable) przeprowadza współczesną zarządzanie danymi biologicznymi, umożliwiając powtarzalne badania i metaanalizy między studiami a gatunkami.

Wyrównanie sekwencji i zestawianie genomu

Wyrównanie krótkich sekwencji

Sequencjonowanie metodą Illumina produkuje miliony krótkich sekwencji (75-300 bp), które muszą być wyrównane do referencyjnego genomu. BWA-MEM2 i Bowtie2 wykorzystują transformację Burrowsa-Wheelera i struktury danych FM-index, co pozwala na prawie dokładne wyrównanie ponad 50 milionów sekwencji do genomu ludzkiego o wielkości 3.2 Gb w ciągu kilku minut. Wyrównanie tworzy pliki SAM/BAM zawierające pozycje sekwencji, oceny jakości i flagi wyrównania. STAR i HISAT2 są wyrównawcami świadoma splicingu dla RNA-seq—zwracają uwagę na sekwencje przekraczające punkty graniczne eksonów. Po-procesowanie po wyrównaniu: samtools do sortowania, indeksowania lub filtrowania, Picard MarkDuplicates zmniejsza bias powtarzalny PCR, GATK BaseRecalibration dostosowuje stopy błędów systematycznych na podstawie pozycji sekwencji i kontekstu nukleotydowego—każde z tych kroków jest kluczowe dla dokładności wykrywania mutacji w etapach dalszych. CIGAR strings w plikach BAM kodują kształt wyrównania: dopasowania, usunięcia, wstawienia i sklejek.

Zestawianie z użyciem długich sekwencji

Sequencjonowanie metodą PacBio (HiFi) i Oxford Nanopore (1-100+ kb) umożliwia pokrycie powtarzalnych regionów, rozwiązywanie strukturalnych mutacji i fazowanie haplotypów, które krótkie sekwencje nie mogą. Zestawianie genomu de novo z użyciem długich sekwencji wykorzystuje asambleery overlap-layout-consensus (OLC): Hifiasm (PacBio HiFi), Flye (Nanopore)—konstruują grafy zestawienia, szukając pokryć sekwencji i rozwiązywując je do ciągłych sekwencji. T2T-CHM13 (telomere-to-telomere) human genome assembly (2022) dodaje ponad 200 Mb niezrozumiałego genomu, w tym wszystkie centromery, telomerę i segmentalne powtarzalności—ukończa referencyjny genom ludzki po 20 latach od oryginalnej opracowania. Zestawianie hybrydowe z użyciem krótkich i długich sekwencji (polishing krótkimi sekwencjami do ramy długiej) osiąga najwyższą dokładność.

demo na żywo · powiązana symulacja● LIVE

Oznaczanie i anotacja wariantów

Oznaczanie SNV i indel

Standardowym narzędziem do wykrywania germlinowych mutacji SNV i małych indelów jest GATK HaplotypeCaller: lokalna de novo together z realigned readami w aktywnych regionach, nastepowane statystyczną obliczeniem prawdopodobieństwa genotywu przy użyciu modeli specyficznych dla pozycji, co tworzy pliki VCF (format wywołania wariantów) zawierające wywołania genotypu i metryki jakości (GQ, DP, FILTER). VQSR (recalibracja jakości wariantów zgodnie z rozkładem Gaussa) użyciem modelu mieszanki Gaussowskiego na podstawie znanych baz wariantów klasyfikuje warianty jako PASS lub filtry. Wykrywanie mutacji somatycznych (paired samples tarczy i normy): GATK Mutect2 identyfikuje tarczowe mutacje korzystając z normali jako tła dla pasemka normalnego; CNVkit i FACETS wykrywają warianty liczbowo-wymiarowe. Standardowe pomiarowanie dokładności na zbiorach prawdy NIST/Genome in a Bottle umożliwia porównanie między oznaczaczykami i potwierdzać wydajność kanału klinicznego.

Analiza RNA-seq

Przepływ pracy RNA-seq: sprawdzenie jakości readów z FastQC; usunięcie adaptatorów za pomocą Trimmomatica lub Cutadaptu; aligment z użyciem STAR lub pseudo-aligmentu Salmon/kallisto (ocena abundancji transcriptów bezpośrednio z readów bez aligmentu); generowanie macierzy liczebności z użyciem featureCounts lub HTSeq-count; różnorodność wyrażania z DESeq2 lub edgeR (modely binomialne dla nadwariantowych danych liczebności z odpowiednimi normalizacjami próbek); enkoder ścieżek z użyciem fgsea lub clusterProfiler. Bezaligmentowa ocena abundancji (Salmon/kallisto) zmniejsza czas obliczen o 100 razy, zachowując równocześnie dokładność. Integracja wielu próbek (korekcja batchu z użyciem ComBat lub limma removeBatchEffect) jest kluczowa dla metaanaliz cross-study. Konsortium ENCODE i GTEx dostarcza referencyjne kompendia wyrażania genów w różnych tissuciech i warunkach.

Bioinformatyka strukturalna

AlphaFold2 (DeepMind, 2021) przewiduje trójwymiarową strukturę proteiny na podstawie pierwotnej sekwencji z dokładnością prawie doświadczalną, wykorzystując cechy wielosekwencyjnego aligmentu ewolucyjnego i uczenie głębokie z użyciem uwagi—rozwiązując 50-letni wyzwanie ogólne w biologii obliczeniowej. Baza danych struktur proteini AlphaFold teraz zawiera przewidywania dla prawie wszystkich ~200 milionów znanych protei. AlphaFold-Multimer rozszerza przewidywania na kompleksy protei; AlphaFold3 (2024) przewiduje struktury protei z DNA, RNA i małych cząsteczek leków. Rosetta przewiduje struktury ab initio, dynamika molekularna (GROMACS, AMBER, NAMD) oraz wiązanie molekularne (AutoDock, Glide) uzupełniają doświadczone struktury w badaniach farmakologicznych, wyznaczając pokoje wiązania, optymalizując kompoundy prowadzące i zrozumiewając interakcje proteina-lek.

Przykłady i zastosowania

Przykład 1: Kliniczny Pipeline Sekwencjonowania Wszystkich Eksomów (WES)

Kliniczne sekwencjonowanie WES do diagnostyki rzadkich chorób genetycznych: kontrola jakości DNA → przygotowanie biblioteki → captura eksomu (Agilent SureSelect, IDT xGen) → sekwencjonowanie na platformie Illumina → aligment BWA-MEM → wywołanie haplotów GATK HaplotypeCaller → anotacja funkcjonalna za pomocą VEP/ANNOVAR → filtryzacja (MAF poniżej 0,01 w gnomAD), predykcja pathogeneiczności (CADD score >20), listy genów chorób (OMIM, ClinVar pathogenic) → analiza trio (identyfikacja nowych mutacji po sekwencjonowaniu obu rodziców jednocześnie) → generowanie raportu do interpretacji klinicznej. Średnia ilość diagnoz 25-35% dla niewydiagnozowanych chorób genetycznych, wzrasta do 40-50%, gdy fenotyp jest dokładny. Kasy nierozwiązane po sekwencjonowaniu WES mogą przechodzić do sekwencjonowania pełnego genomu detekując mutacje non-coding, strukturalne i rozszerzenia powtarzalne, które mogą zostać pominięte w eksomie.

Przykład 2: Bioinformatyka GWAS

GWAS (genomowo rozszerzone badania asocjacyjne) testują miliony SNPów na ich związek z cechą phenotypową pośród setki tysięcy osób. Pipeline kontrola jakości: dane genotyping array → kontrola jakości próbek (stopy wywołania, sprawdzenie płci, usuwanie wywrotów) → kontrola jakości SNPów (filtr MAF, odstępstwa HWE, stopy wywołania) → analiza głównych komponentów pochodzenia (PCA) → imputacja (używając panelu Haplotype reference consortium rozszerzającego 700k SNPów array do około 10M wariantów imputowanych) → test asocjacyjny (logistyczna lub liniowa regresja PLINK2 z użyciem PC jako korektorów) → meta-analiza wielu grup etnicznych (METAL) → skupienie LD do identyfikacji niezależnych sygnałów asocjacyjnych → szczegółowe mapowanie (SuSiE, FINEMAP polyfine) do prioritizacji wariantów przyczynowych → kolokalizacja z eQTLami do odkrycia prawdopodobnie przyczynowych genów.

Przykład 3: Pipeline Bioinformatyki Sekwencjonowania RNA na jednej komórce (scRNA-seq)

bioinformatyka scRNA-seq: demultiplexowanie i kwantyfikacja raw reads z użyciem Cell Ranger lub STARsolo (mapowanie czytelników do kodów barowych komórek i UMI) → filtracja jakości (usuwanie pustych dropletów, komórek martwych o wysokich czytelnikach mitochondrialnych) → normalizacja (scran pooling lub sctransform) → zmniejszenie wymiarowości (PCA → UMAP lub tSNE) → grupowanie (Seurat Louvain, Scanpy Leiden) → anotacja typu komórki (wyrażanie markerów genowych, transfer referencyjnych zestawów danych z użyciem SingleR lub Seurat label transfer) → wyrażenie różnicowe między warunkami (pseudobulk z DESeq2, uwzględniając próbki indywidualne jako powtarzające się próby biologiczne) → analiza trajektorii (pseudoczas: Monocle3, scVelo RNA velocity) do odkrycia trajektoriów rozwojowych i relacji linii pochodzenia z danych transkrypcyjnych.

Przykład 4: Analiza Metagenomiki

analiza metagenomowa sztucznym przesłaniem (shotgun) próbek mikrobiomu: dekontaminacja hosta raw reads (mapowanie do genomu hosta za pomocą bowtie2, usuwanie czytelników ludzkich) → klasyfikacja na poziomie gatunku (klasyczne klasyfikacje k-merów Kraken2 przeciwko zaktualizowanej bazy NCBI, Metaphlan3 użyciem genów markerowych specyficznych dla kladek do profilowania względnej bogactwa) → anotacja funkcjonalna (HUMAnN3 mapowanie do rodzin proteinowych UniRef90) → de novo together (MEGAHIT, metaSPAdes) → binning (MetaBat2, MaxBin2 podział kontigów zbudowanych w grupy genomowe na podstawie pokrycia i składu czteronukleotydowego) → ocena jakości binów (CheckM oceny kompletności i poziomu kontaminacji poprzez geny markerowe jednokopiowe) → klasyczna klasifikacja taxonomiczna binów (GTDB-Tk) → metagenome-assembled genomes (MAGs) do odkrycia nowych gatunków z mikroorganizmów niefotografowanych.

Spróbuj to na żywo

Wszystko powyżej działa w twojej przeglądarce — otwórz Sequence Alignment DP Landscape i zmieniaj parametry podczas jego działania. Nic nie jest zainstalowane, nic nie jest przesyłane, cała modelika istnieje w jednym zakładku.

Wypróbuj na żywo

Wszystko powyżej działa bezpośrednio w Twojej przeglądarce — otwórz Genomics Pipeline Flow Simulator i zmieniaj parametry podczas działania. Nic nie jest instalowane ani przesyłane na serwer, cały model działa w jednej karcie.

▶ Otwórz symulację Genomics Pipeline Flow Simulator

Co znalazłeś?

Dodaj kroki odtworzenia (opcjonalnie)