Аналіз послідовностей: Основи
Біоінформатика: застосування обчислювальних інструментів для розуміння біологічних даних – переважно послідовностей ДНК, РНК та білків. Революція секвенування ДНК: секвенування Санджера (1977) → Проект «Геном людини» ($3 млрд, 13 років) → Illumina NGS ($600 млн, 2 дні) → секвенування Nanopore (портативний, реальний час, довгі читання >4 Мп). Аналіз послідовностей: порівняння послідовностей для пошуку подібності – докази еволюційних, структурних або функціональних зв’язків. BLAST (Basic Local Alignment Search Tool): найпоширеніший інструмент біоінформатики – порівнює запитову послідовність з базами даних за лічені секунди. Smith-Waterman: оптимальне локальне вирівнювання (динамічне програмування, складність O(mn)). Багатопоточне вирівнювання послідовностей (MSA): ClustalW, MUSCLE, MAFFT, T-Coffee – вирівнювання 3+ послідовностей розкриває консервативні регіони. Матриці оцінки: BLOSUM62, PAM250 – кількісно визначають ймовірності заміни амінокислот. Приховані марковські моделі (HMMs): HMMER, база даних Pfam – профільне пошукове вирівнювання для родин та доменів білків.
Геноміка та бази даних
GenBank (NCBI): понад 2,5 трильйона парів нуклеотидів у понад 250 мільйонів послідовностей — основна нуклеїнова база даних. UniProt: всеосяжна база даних білків — рецензована (Swiss-Prot, 570 тис. записів) та нерецензована (TrEMBL, понад 250 млн. записів). PDB (Бібліотека кристалічних структур білків): понад 200 000 експериментально визначених 3D структур. Ensembl / UCSC Genome Browser: платформи для аннотації геному та візуалізації. Gene Ontology (GO): стандартизований словник функцій генів/білків у різних видах — молекулярна функція, біологічний процес, клітинний компонент. Метагеноміка: секвенування зразків навколишнього середовища без виділення організмів — вивчення цілих мікробних спільнот. Секвенування окремих клітин: секвенування окремих клітин розкриває клітинну неоднорідність — 10x Genomics Chromium, Drop-seq. Просторовий транскриптоміка: картинг експресії генів за розташуванням у тканині — Visium (10x), MERFISH, Slide-seq. Інтеграція мультиоміки: об'єднання геноміки, транскриптомії, протеомної біохімії та метаболоміки для системного розуміння.
Філогенетика та Еволюція
Філогенетика: реконструкція еволюційних зв’язків на основі послідовних даних – побудова «родинного дерева». Методи: Максимальна Парамінія (найменша кількість еволюційних змін), Найбільш Ймовірний Дерево (найбільш ймовірне дерево, враховуючи модель), Байєсівський Висновок (після-ймовірність дерев). Бутстрапінг: статистична підтримка гілок дерева – практика включає 1000+ реплік. Мовковий годинник: мутації накопичуються приблизно з постійною швидкістю → калібрування часу розходження. Горизонтальний обмін генетичним матеріалом (ГМ): обмін генами між неспорідненими видами – ускладнює «родинне дерево» для прокаріотів. Філогенемогеноміка: використання цілих геномів для філогенетичного аналізу – розв’язує складні зв’язки. Геномна епідеміологія SARS-CoV-2: моніторинг еволюції вірусу в реальному часі, виникнення та поширення варіантів. Nextstrain: відкрита платформа для геномного спостереження за патогенами – використовується у всьому світі під час COVID-19. Древнє ДНК: секвенування геномів неандертальців і дениківян виявило схрещування з сучасними людьми (Свенте Паабо, Нобелівська премія 2022).
Структурна та Штучний Інтелект Біоінформатика
Структурна біоінформатика: прогнозування та аналіз 3D-структур біомолекул. Моделювання за гомологією: побудова структури білка на основі відомого шаблону — SWISS-MODEL, Modeller. AlphaFold 2 (DeepMind): революціонізував прогнозування структур — атомний рівень точності лише з послідовності. AlphaFold DB: понад 200 мільйонів передбачених структур, доступних безкоштовно. Молекулярне докінгування: прогнозування взаємодії малих молекул з білковими мішенями — AutoDock, Glide, GOLD. Динаміка молекул (MD): моделювання рухів атомів у часі — GROMACS, AMBER, NAMD. Лабораторія відкриття ліків: ідентифікація цілі → віртуальний скринінг → оптимізація лідера → прогнозування ADMET → клінічний кандидат. Штучний інтелект у біоінформатиці: глибоке навчання для прогнозування впливу варіацій (DeepVariant, EVE), імпутації експресії генів, прогнозування взаємодії лікарського засобу та цілі. Великі мовні моделі для біології: ESM (Meta), ProGen, ProtTrans — мовні моделі білків, навчені на мільярдах послідовностей. Штучний інтелект для одноклітинних технологій: scVI, scBERT, CellTypist — автоматизована аннотація типів клітин та висновки про траєкторії. Майбутнє: цифрові двійники клітин і організмів — повні обчислювальні моделі для персоналізованої медицини.
Спробуйте наживо
Усе, що вище, працює прямо у вашому браузері — відкрийте Sequence Alignment: DNA Matching in 3D і змінюйте параметри під час роботи. Нічого не встановлюється, нічого не завантажується на сервер, уся модель живе в одній вкладці.
▶ Відкрити симуляцію Sequence Alignment: DNA Matching in 3D