Składanie genomu de novo — eukarionty
Genom rośliny, zwierzęcia lub grzyba złożony od podstaw, z adnotacją genów opartą na danych, a nie tylko na predykcji ab initio.
Kiedy warto składać genom eukariotyczny
data2biology składa de novo genomy roślin, zwierząt i grzybów: z odczytów długich (PacBio HiFi lub Oxford Nanopore), z uporządkowaniem do poziomu chromosomów na podstawie danych Hi-C i z adnotacją genów wspartą danymi RNA-Seq. Genomy eukariotyczne są o kilka rzędów wielkości większe od bakteryjnych, zawierają introny, rozległe rejony powtarzalne i często występują w wielu kopiach haploidalnych. Ich składanie to projekt na tygodnie, nie na godziny, i wymaga innych narzędzi oraz innej dyscypliny kontroli jakości. Własny genom referencyjny opłaca się wtedy, gdy planujesz dłuższą pracę nad gatunkiem: mapowanie cech, badania populacyjne, analizy ekspresji czy porównania ewolucyjne.
Pracowaliśmy zarówno z organizmami o niewielkich, zwartych genomach, jak i z gatunkami poliploidalnymi oraz silnie heterozygotycznymi, gdzie oddzielenie haplotypów jest odrębnym wyzwaniem. Jeśli nie masz pewności, czy Twoje dane wystarczą do sensownego złożenia, ocenimy to przed rozpoczęciem projektu.
Przebieg analizy
Poniżej opisujemy schemat, według którego typowo prowadzimy tego rodzaju analizy. Nie jest to sztywna procedura: dobór narzędzi zależy od organizmu, typu biblioteki, głębokości sekwencjonowania i pytania badawczego, a standardy w bioinformatyce zmieniają się szybko. Metodykę uzgadniamy z Tobą przed startem projektu i aktualizujemy wraz z rozwojem narzędzi oraz baz referencyjnych.
Na co zwracamy uwagę
Jakość materiału decyduje o wyniku
Składanie genomu z odczytów długich wymaga DNA o wysokiej masie cząsteczkowej. Zdegradowany materiał daje krótkie odczyty, a te — pofragmentowane złożenie, którego nie da się naprawić na etapie obliczeniowym. Jeśli izolacja jest jeszcze przed Tobą, warto porozmawiać wcześniej niż później.
Jak czytać wynik BUSCO
Wysoka kompletność nie oznacza automatycznie dobrego złożenia, a wysoki odsetek genów zduplikowanych bywa sygnałem nieusuniętej redundancji haplotypowej, nie rzeczywistej duplikacji genomu. Dlatego raportujemy BUSCO razem z oceną Merqury i statystykami ciągłości, a nie jako pojedynczą liczbę wyjętą z kontekstu.
Adnotacja bez danych RNA-Seq
Adnotację można wykonać wyłącznie na podstawie białek pokrewnych gatunków, ale modele genów są wtedy wyraźnie mniej dokładne — zwłaszcza w zakresie granic egzonów, izoform alternatywnych i rejonów nieulegających translacji. Jeśli to możliwe, warto zsekwencjonować choćby kilka bibliotek RNA z różnych tkanek lub warunków; to jedna z najbardziej opłacalnych inwestycji w całym projekcie.
Co otrzymujesz
| Plik | Format | Co zawiera |
|---|---|---|
| genome.fasta | FASTA | Złożona sekwencja genomu. Przy skafoldowaniu Hi-C rekordy odpowiadają pseudochromosomom, a pozostałe sekwencje trafiają do puli nieprzypisanej. |
| genome.softmasked.fasta | FASTA | Ta sama sekwencja z rejonami powtarzalnymi zapisanymi małymi literami — wersja używana przy adnotacji i przy mapowaniu. |
| annotation.gff3 | GFF3 |
Modele genów w układzie hierarchicznym: gene zawiera mRNA, a mRNA zawiera egzony, CDS oraz rejony UTR. Jeden wiersz na cechę, dziewięć kolumn.
|
| proteins.faa / cds.fna | FASTA | Sekwencje białkowe i kodujące dla wszystkich modeli genów, z identyfikatorami zgodnymi z plikiem GFF3. |
| functional_annotation.xlsx | XLSX |
Katalog genów w formie arkusza — najczęściej otwierany plik w całym pakiecie.
|
| repeats/ | FASTA + GFF3 + TSV | Biblioteka powtórzeń specyficzna dla gatunku, ich lokalizacje w genomie oraz zestawienie udziału poszczególnych klas elementów. |
| quality/ | HTML + TXT |
Raporty jakości złożenia, raportowane łącznie, nie pojedynczo.
|
| jbrowse2/ | konfiguracja | Gotowa konfiguracja przeglądarki genomu ze ścieżkami adnotacji, powtórzeń i pokrycia RNA-Seq — do uruchomienia lokalnie lub na Twoim serwerze. |
| methods.docx | DOCX | Szkic sekcji metod z wersjami narzędzi, parametrami, statystykami złożenia i cytowaniami. |
Czego potrzebujemy od Ciebie
- Odczyty długie w formacie FASTQ lub BAM, wraz z informacją o platformie i chemii
- Szacowaną wielkość genomu i ploidalność, jeśli są znane z cytometrii lub literatury
- Dane Hi-C, jeśli oczekujesz złożenia na poziomie chromosomów
- Dane RNA-Seq z możliwie różnych tkanek lub warunków — znacząco poprawiają adnotację
- Informację o pokrewnych gatunkach z dostępnym genomem, które można wykorzystać jako wsparcie
Wycena i współpraca
Każdy projekt wyceniamy indywidualnie. Koszt zależy przede wszystkim od liczby próbek, dostępności genomu referencyjnego, liczby porównań i zakresu analiz, o które prosisz.
- Piszesz do nas, co chcesz zbadać i jakimi danymi dysponujesz.
- Jeśli coś wymaga doprecyzowania, umawiamy krótką rozmowę — bezpłatnie i bez zobowiązań.
- W ciągu 3–5 dni roboczych dostajesz wycenę wraz z zakresem prac, listą plików wynikowych i terminem realizacji.
- Decydujesz. Wycena jest niezobowiązująca.
Zakres i koszt tego typu projektów różnią się na tyle mocno, że podanie jednej reprezentatywnej kwoty byłoby mylące. Jeśli potrzebujesz rzędu wielkości jeszcze przed formalną wyceną, napisz — orientacyjny przedział podamy od ręki.
Podane kwoty są orientacyjne, wyrażone w wartościach netto; do ceny doliczamy podatek VAT zgodnie z obowiązującymi przepisami. Nie stanowią one oferty w rozumieniu Kodeksu cywilnego. Więcej o zasadach współpracy w FAQ.
Masz dane do analizy?
Napisz, co chcesz zbadać, a wspólnie ustalimy zakres analizy i harmonogram. Rozmowa o projekcie i przygotowanie wyceny są bezpłatne.
Zapytaj o wycenę Zobacz przykładową analizę