Технології секвенування ДНК
Існують різні технології секвенування ДНК, кожна з яких має свої сильні та слабкі сторони. Секвенування Сенгера, метод із зупиненням ланцюга за допомогою дидеоноклюлових нуклеотидів, історично домінував для отримання коротких послідовностей. Технології наступного покоління (NGS), такі як секвенування ‘by synthesis’ від Illumina, дозволяють масово паралельне секвенування мільйонів або навіть мільярдів фрагментів ДНК одночасно.
ΔE = qh + 2q(ΔT)²/T³ (Change in energy during chain termination)
Обробка Первинних Послідовностей – Контроль Якості та Обрізка
Початкові дані NGS (Next-Generation Sequencing) складаються з необроблених читів, які часто містять помилки, що виникли під час процесу секвенування. Кроки контролю якості передбачають оцінку розподілу довжини читів та ідентифікацію базових одиниць низької якості. Обрізка видаляє ці неточні або короткі фрагменти, зазвичай використовуючи алгоритми, такі як ‘Trim Galore’, які застосовують підхід з ковзним вікном для оцінки балів якості базових одиниць та видалення базових одиниць нижче певного порогу (наприклад, Q20). Цей крок є критично важливим для точного подальшого аналізу.
Read Length = L (meters) ; Error Rate = ε (per base)
Збірка – Відновлення Геному
Збірка геному має на меті відновити повний послідовність геному з коротких читань. Збірку *de novo* використовують алгоритми, такі як OLC (overlap-layout-consensus) або графічні методи, для ідентифікації перекриваючихся областей та побудови безперервної послідовності. Збірка на основі референції зводиться до вирівнювання читань проти відомого геному-референсу, що спрощує процес, але потребує відповідного референсного геному.
N = Σ(nᵢ) (Total number of reads; nᵢ is the read length)
Виявлення варіацій – ідентифікація відмінностей
Виявлення варіацій визначає відмінності між послідовністю геному, що була секвенувана, та опорним геномом. Зазвичай це передбачає збірку (alignment) чонів до опорного і виявлення областей, де збірка суттєво відрізняється. Типовими типами варіацій є однонуклеотидні поліморфізми (SNP), вставки та делеції. Для визначення, чи є спостережувана відмінність справжньою генетичною варіацією, чи просто помилкою секвенування, використовуються статистичні методи.
p = (Number of Variants) / (Genome Size)
Аннотація – Інтерпретація Результатів
Аннотація передбачає призначення біологічного значення ідентифікованим варіантам та геномним регіонам. Це включає визначення розташування генів, прогнозування функції білка на основі гомології послідовностей та виявлення регуляторних елементів. Бази даних, такі як NCBI’s Gene database та Ensembl, надають всебічну інформацію щодо аннотації.
Gene Coverage = (Number of Reads Mapping to a Gene) / (Total Read Count)
Інтеграція та Управління Потоками Роботи
Біоінформаційні потоки часто реалізуються за допомогою систем управління потоками, таких як Nextflow або Snakemake. Ці інструменти автоматизують виконання складних аналізів, дозволяючи дослідникам ефективно обробляти великі набори даних та відтворювати результати. Проектування потоку повинно враховувати залежності даних, вимоги до ресурсів (CPU, пам'ять) та потенційні вузькі місця.
Time = f(Data Size, Algorithm Complexity)
Часті запитання
Яка різниця між глибиною прочитання та покриттям?
Глибина прочитання позначає кількість прочитань, які збігаються з конкретною областю геному. Покриття представляє середню кількість прочитань, що відображаються для кожного нуклеотидного базину в цій області, розраховується як глибина прочитання поділена на довжину області.
Чому важливо видаляти якості?
Видалення якості усуває неточні основи, які генеруються під час секвенування, що може призвести до помилок у подальших аналізах, таких як виявлення варіацій. Погана якість даних призводить до неточних результатів.
Які популярні біоінформаційні бази даних використовуються в аналізі?
Популярні бази даних включають NCBI’s GenBank, Ensembl, UCSC Genome Browser та dbSNP, кожна з яких надає різні типи генетичної інформації – послідовності, анотації, варіації тощо.
Спробуйте наживо
Усе, що вище, працює прямо у вашому браузері — відкрийте Bioinformatics Simulation і змінюйте параметри під час роботи. Нічого не встановлюється, нічого не завантажується на сервер, уся модель живе в одній вкладці.
▶ Відкрити симуляцію Bioinformatics Simulation