🔍 Вирівнювання послідовностей
BLAST (Basic Local Alignment Search Tool)
Швидкий пошук схожих послідовностей у базах даних. Еврістика: seed-and-extend. Використовується для ідентифікації функції, гомології, анотації. Версії: BLASTP (білки), BLASTN (нуклеотиди), PSI-BLAST (профілі).
Smith-Waterman
Динамічне програмування для локального вирівнювання. Точніше за BLAST, але повільніше. Використовується для точного вирівнювання, коротких послідовностей. O(nm) складність.
Needleman-Wunsch
Глобальне вирівнювання через динамічне програмування. Використовується для вирівнювання повних послідовностей. Gap penalties, scoring matrices (BLOSUM, PAM).
Множинне вирівнювання
ClustalW, MUSCLE, MAFFT для вирівнювання багатьох послідовностей. Progressive alignment, iterative refinement. Використовується для філогенетики, ідентифікації консервованих областей.
🧬 Анотація геномів
Передбачення генів
Ідентифікація генів у послідовностях геномів. Методи: гомологічне пошуку, ab initio передбачення (Hidden Markov Models, machine learning), комбінація підходів. GENSCAN, AUGUSTUS, GlimmerHMM.
Hidden Markov Models (HMM)
Статистичні моделі для передбачення структури з послідовності. Використовуються для генів, білкових доменів, RNA структури. HMMER для пошуку доменів. Ефективні для консервованих патернів.
Функціональна анотація
Присвоєння функцій генам/білкам. Методи: гомологія (BLAST), domain prediction (Pfam, InterPro), GO анотація, pathway analysis. Комбінація доказів для високої точності.
Передбачення регуляторних елементів
Промотори, enhancers, transcription factor binding sites. Motif finding (MEME, HOMER), conservation analysis, machine learning. Розуміння регуляції генів.
🌳 Філогенетика
Побудова дерев
Методи: максимальна парсимонія, максимальна правдоподібність, байєсівські методи, distance-based (neighbor-joining, UPGMA). Розуміння еволюційних зв'язків. PhyML, RAxML, BEAST.
Bootstrap аналіз
Оцінка надійності філогенетичних дерев через повторну вибірку. Bootstrap values показують підтримку гілок. Критично для інтерпретації дерев.
Молекулярні годинники
Оцінка часів розходження на основі мутацій. Калібрування з палеонтологічних даних. Розуміння темпів еволюції, датування подій.
🧪 Передбачення структури
Гомологічне моделювання
Моделювання структури на основі гомологічних структур. Modeller, Swiss-Model. Вимагає достатньої схожості (>30%). Точність залежить від якості template.
AlphaFold та deep learning
Революція у передбаченні структури через deep learning. AlphaFold 2 досяг високої точності для багатьох білків. Трансформація поля. Швидке та точне передбачення.
Ab initio передбачення
Передбачення з нуля без гомологічних структур. Фізичні принципи, energy minimization. Складніше, менш точне. Rosetta, I-TASSER.
📈 Аналіз даних
Статистичні методи
Тести значимості, multiple testing correction (FDR, Bonferroni), регресія, кластеризація. R/Bioconductor для біостатистики. Критично для валідних висновків.
Машинне навчання
Класифікація, регресія, кластеризація для біологічних даних. Передбачення функції, класифікація послідовностей, виявлення патернів. scikit-learn, TensorFlow, PyTorch для біології.
Network аналіз
Graph algorithms для біологічних мереж. Centrality measures, community detection, shortest paths. Cytoscape, NetworkX. Розуміння системної біології.
Time-series аналіз
Аналіз динамічних даних: транскриптоміка, метаболоміка в часі. Виявлення патернів, кластеризація траєкторій. Розуміння динаміки біологічних процесів.
💾 Обробка даних
NGS обробка
Аналіз даних секвенування наступного покоління: alignment (BWA, Bowtie), variant calling (GATK, SAMtools), RNA-seq (TopHat, STAR). Великі обсяги даних потребують ефективних алгоритмів.
Quality control
Перевірка якості даних: FastQC, adapter removal, trimming. Критично для валідних результатів. Автоматизація workflow.
Нормалізація та обробка
Нормалізація експресії генів, batch effect correction, normalization для різних технологій. Важливо для порівнянь.
🔬 Спеціалізовані алгоритми
Motif finding
MEME, HOMER для пошуку консервованих мотивів у послідовностях. Використовується для передбачення регуляторних елементів, TF binding sites. Expectation-maximization, Gibbs sampling.
RNA структура
Передбачення вторинної структури РНК: minimum free energy, comparative analysis. RNAfold, Vienna RNA. Важливо для функції РНК.
Метагеноміка
Аналіз складних спільнот мікроорганізмів. Binning, assembly, taxonomic classification. MetaSPAdes, MEGAHIT. Розуміння мікробіому.
Single-cell аналіз
Аналіз даних одноклітинного секвенування: нормалізація, кластеризація, trajectory inference. Seurat, Scanpy. Розуміння клітинної гетерогенності.
⚡ Оптимізація та продуктивність
Паралелізація
Використання багатоядерних процесорів, GPU, кластерів для прискорення. MPI, OpenMP, CUDA. Великі обсяги даних потребують паралельності.
Алгоритмічна складність
Оптимізація для швидкості: eврістики, індексація, hash tables, Bloom filters. Баланс між точністю та швидкістю.
Хмарні обчислення
Використання хмарних платформ для масштабування. AWS, Google Cloud, Azure. Доступ до великих ресурсів без власної інфраструктури.
Спробуйте наживо
Усе, що вище, працює прямо у вашому браузері — відкрийте Protein Folding Visualiser і змінюйте параметри під час роботи. Нічого не встановлюється, нічого не завантажується на сервер, уся модель живе в одній вкладці.
▶ Відкрити симуляцію Protein Folding Visualiser