Składanie genomu de novo — eukarionty

Genom rośliny, zwierzęcia lub grzyba złożony od podstaw, z adnotacją genów opartą na danych, a nie tylko na predykcji ab initio.

Kiedy warto składać genom eukariotyczny

data2biology składa de novo genomy roślin, zwierząt i grzybów: z odczytów długich (PacBio HiFi lub Oxford Nanopore), z uporządkowaniem do poziomu chromosomów na podstawie danych Hi-C i z adnotacją genów wspartą danymi RNA-Seq. Genomy eukariotyczne są o kilka rzędów wielkości większe od bakteryjnych, zawierają introny, rozległe rejony powtarzalne i często występują w wielu kopiach haploidalnych. Ich składanie to projekt na tygodnie, nie na godziny, i wymaga innych narzędzi oraz innej dyscypliny kontroli jakości. Własny genom referencyjny opłaca się wtedy, gdy planujesz dłuższą pracę nad gatunkiem: mapowanie cech, badania populacyjne, analizy ekspresji czy porównania ewolucyjne.

Pracowaliśmy zarówno z organizmami o niewielkich, zwartych genomach, jak i z gatunkami poliploidalnymi oraz silnie heterozygotycznymi, gdzie oddzielenie haplotypów jest odrębnym wyzwaniem. Jeśli nie masz pewności, czy Twoje dane wystarczą do sensownego złożenia, ocenimy to przed rozpoczęciem projektu.

Przebieg analizy

Poniżej opisujemy schemat, według którego typowo prowadzimy tego rodzaju analizy. Nie jest to sztywna procedura: dobór narzędzi zależy od organizmu, typu biblioteki, głębokości sekwencjonowania i pytania badawczego, a standardy w bioinformatyce zmieniają się szybko. Metodykę uzgadniamy z Tobą przed startem projektu i aktualizujemy wraz z rozwojem narzędzi oraz baz referencyjnych.

Dane wejściowe
Odczyty długie (PacBio HiFi lub ONT) · opcjonalnie Hi-C do skafoldowania · opcjonalnie RNA-Seq i białka pokrewnych gatunków do adnotacji
Kontrola jakości i profil k-merowy
Ocena odczytów oraz oszacowanie wielkości genomu, poziomu heterozygotyczności i ploidalności jeszcze przed składaniem — to determinuje dalsze decyzje.
NanoPlotJellyfishGenomeScope2Smudgeplot
Składanie kontigów
Asembler dobieramy do typu odczytów i poziomu heterozygotyczności. Przy danych HiFi możliwe jest rozdzielenie haplotypów już na tym etapie.
hifiasmFlyeVerkkoCanu
Usunięcie duplikacji haplotypowych
Nadmiarowe kopie regionów heterozygotycznych zawyżają wielkość złożenia i sztucznie podnoszą liczbę zduplikowanych genów. Usuwamy je na podstawie rozkładu pokrycia.
purge_dups
Skafoldowanie do poziomu chromosomów
Dane Hi-C pozwalają uporządkować i zorientować kontigi w pseudochromosomy. Wynik weryfikujemy na mapie kontaktów i w razie potrzeby poprawiamy ręcznie.
YaHSSALSA2PretextViewJuicebox
Ocena jakości złożenia
Ciągłość, kompletność zestawu genów jednokopijnych oraz niezależna ocena dokładności na podstawie k-merów z odczytów.
QUASTBUSCOMerqury
Identyfikacja i maskowanie powtórzeń
Budujemy bibliotekę powtórzeń specyficzną dla gatunku, zamiast polegać wyłącznie na bazach ogólnych, a następnie maskujemy genom przed adnotacją genów.
RepeatModeler2RepeatMaskerEDTA
Adnotacja strukturalna genów
Modele genów budujemy w oparciu o dowody: transkrypty z RNA-Seq i białka pokrewnych gatunków, wspomagane predykcją ab initio. Osobno adnotujemy tRNA i inne ncRNA.
BRAKER3HelixerfunannotatetRNAscan-SEInfernal
Adnotacja funkcjonalna
Przypisanie domen, terminów GO, szlaków KEGG i opisów produktów na podstawie podobieństwa do baz białkowych i sygnatur domenowych.
InterProScaneggNOG-mapperDIAMOND vs Swiss-Prot
Pakiet danych i przeglądarka genomu
Konfigurujemy przeglądarkę, w której możesz obejrzeć dowolny gen wraz ze ścieżkami dowodowymi, oraz przygotowujemy pliki do deponowania.
JBrowse 2IGV
Wyniki
Sekwencja genomu · adnotacja GFF3 · białka i CDS · biblioteka powtórzeń · raporty BUSCO i Merqury · arkusz adnotacji funkcjonalnej
Typowy przepływ danych przy składaniu genomu eukariotycznego. Etap 4 wykonujemy tylko wtedy, gdy dostępne są dane Hi-C.

Na co zwracamy uwagę

Jakość materiału decyduje o wyniku

Składanie genomu z odczytów długich wymaga DNA o wysokiej masie cząsteczkowej. Zdegradowany materiał daje krótkie odczyty, a te — pofragmentowane złożenie, którego nie da się naprawić na etapie obliczeniowym. Jeśli izolacja jest jeszcze przed Tobą, warto porozmawiać wcześniej niż później.

Jak czytać wynik BUSCO

Wysoka kompletność nie oznacza automatycznie dobrego złożenia, a wysoki odsetek genów zduplikowanych bywa sygnałem nieusuniętej redundancji haplotypowej, nie rzeczywistej duplikacji genomu. Dlatego raportujemy BUSCO razem z oceną Merqury i statystykami ciągłości, a nie jako pojedynczą liczbę wyjętą z kontekstu.

Adnotacja bez danych RNA-Seq

Adnotację można wykonać wyłącznie na podstawie białek pokrewnych gatunków, ale modele genów są wtedy wyraźnie mniej dokładne — zwłaszcza w zakresie granic egzonów, izoform alternatywnych i rejonów nieulegających translacji. Jeśli to możliwe, warto zsekwencjonować choćby kilka bibliotek RNA z różnych tkanek lub warunków; to jedna z najbardziej opłacalnych inwestycji w całym projekcie.

Co otrzymujesz

Plik Format Co zawiera
genome.fasta FASTA Złożona sekwencja genomu. Przy skafoldowaniu Hi-C rekordy odpowiadają pseudochromosomom, a pozostałe sekwencje trafiają do puli nieprzypisanej.
genome.softmasked.fasta FASTA Ta sama sekwencja z rejonami powtarzalnymi zapisanymi małymi literami — wersja używana przy adnotacji i przy mapowaniu.
annotation.gff3 GFF3 Modele genów w układzie hierarchicznym: gene zawiera mRNA, a mRNA zawiera egzony, CDS oraz rejony UTR. Jeden wiersz na cechę, dziewięć kolumn.
  • seqid, source, type — chromosom, źródło modelu, rodzaj cechy
  • start, end, strand, phase — współrzędne, orientacja i ramka odczytu
  • attributes — ID i Parent wiążące cechy w hierarchię, plus nazwa i opis
  • Miara poparcia modelu przez dowody transkryptomiczne, jeśli dane RNA-Seq były dostępne
proteins.faa / cds.fna FASTA Sekwencje białkowe i kodujące dla wszystkich modeli genów, z identyfikatorami zgodnymi z plikiem GFF3.
functional_annotation.xlsx XLSX Katalog genów w formie arkusza — najczęściej otwierany plik w całym pakiecie.
  • gene_id, transcript_id, chromosom, współrzędne, liczba egzonów, długość
  • Najlepsze dopasowanie do Swiss-Prot wraz z wartością e i identycznością
  • Domeny Pfam i sygnatury InterPro
  • Terminy GO, numery KEGG KO i kategorie COG
  • Opis produktu oraz flaga, czy model ma poparcie w danych RNA-Seq
repeats/ FASTA + GFF3 + TSV Biblioteka powtórzeń specyficzna dla gatunku, ich lokalizacje w genomie oraz zestawienie udziału poszczególnych klas elementów.
quality/ HTML + TXT Raporty jakości złożenia, raportowane łącznie, nie pojedynczo.
  • QUAST: liczba skafoldów, N50, L50, całkowita długość, udział luk
  • BUSCO: kompletne pojedyncze, zduplikowane, fragmentaryczne i brakujące
  • Merqury: wartość QV oraz kompletność k-merowa względem odczytów
  • Mapa kontaktów Hi-C, jeśli wykonano skafoldowanie
jbrowse2/ konfiguracja Gotowa konfiguracja przeglądarki genomu ze ścieżkami adnotacji, powtórzeń i pokrycia RNA-Seq — do uruchomienia lokalnie lub na Twoim serwerze.
methods.docx DOCX Szkic sekcji metod z wersjami narzędzi, parametrami, statystykami złożenia i cytowaniami.

Czego potrzebujemy od Ciebie

  • Odczyty długie w formacie FASTQ lub BAM, wraz z informacją o platformie i chemii
  • Szacowaną wielkość genomu i ploidalność, jeśli są znane z cytometrii lub literatury
  • Dane Hi-C, jeśli oczekujesz złożenia na poziomie chromosomów
  • Dane RNA-Seq z możliwie różnych tkanek lub warunków — znacząco poprawiają adnotację
  • Informację o pokrewnych gatunkach z dostępnym genomem, które można wykorzystać jako wsparcie

Wycena i współpraca

Każdy projekt wyceniamy indywidualnie. Koszt zależy przede wszystkim od liczby próbek, dostępności genomu referencyjnego, liczby porównań i zakresu analiz, o które prosisz.

  1. Piszesz do nas, co chcesz zbadać i jakimi danymi dysponujesz.
  2. Jeśli coś wymaga doprecyzowania, umawiamy krótką rozmowę — bezpłatnie i bez zobowiązań.
  3. W ciągu 3–5 dni roboczych dostajesz wycenę wraz z zakresem prac, listą plików wynikowych i terminem realizacji.
  4. Decydujesz. Wycena jest niezobowiązująca.

Zakres i koszt tego typu projektów różnią się na tyle mocno, że podanie jednej reprezentatywnej kwoty byłoby mylące. Jeśli potrzebujesz rzędu wielkości jeszcze przed formalną wyceną, napisz — orientacyjny przedział podamy od ręki.

Podane kwoty są orientacyjne, wyrażone w wartościach netto; do ceny doliczamy podatek VAT zgodnie z obowiązującymi przepisami. Nie stanowią one oferty w rozumieniu Kodeksu cywilnego. Więcej o zasadach współpracy w FAQ.

Masz dane do analizy?

Napisz, co chcesz zbadać, a wspólnie ustalimy zakres analizy i harmonogram. Rozmowa o projekcie i przygotowanie wyceny są bezpłatne.

Zapytaj o wycenę Zobacz przykładową analizę