Ακολουθία FASTA (.fasta)

Bioinformatics Τυπικό

Το FASTA είναι η πανταχού παρούσα, θεμελιώδης μορφή αρχείου της βιοinformatics και της γονιδιωματικής, που αντιπροσωπεύει ακολουθίες νουκλεοτιδίων (DNA, RNA) και ακολουθίες πρωτεϊνών αμινοξέων χρησιμοποιώντας καθολικούς κωδικούς ενός γράμματος.

Μετατροπή FASTA σε GENBANK

Δωρεάν μετατροπέας από FASTA σε GENBANK εντός του προγράμματος περιήγησης. Μετατρέψτε αρχεία άμεσα στη συσκευή σας.

Επιθεώρηση & Μεταδεδομένα

Τα λειτουργικά συστήματα και τα εργαλεία ανάλυσης αρχείων αναγνωρίζουν τα αρχεία FASTA ελέγχοντας την αρχική δυαδική ακολουθία byte:

Επιλέξτε ή αποθέστε αρχεία εδώ

100% ιδιωτική μετατροπή εντός προγράμματος περιήγησης - τα αρχεία δεν φεύγουν ποτέ από τη συσκευή σας

ή επικόλληση Ctrl+V
Εγγύηση Απορρήτου Μηδενικής Μετάδοσης Δικτύου: 0 byte μεταφορτώθηκαν σε εξωτερικούς διακομιστές. Όλη η επεξεργασία πραγματοποιήθηκε τοπικά στο sandbox του προγράμματος περιήγησής σας.

Υπογραφή κεφαλίδας σε επίπεδο byte (Magic Bytes)

Τα λειτουργικά συστήματα και τα εργαλεία ανάλυσης αρχείων αναγνωρίζουν τα αρχεία FASTA ελέγχοντας την αρχική δυαδική ακολουθία byte:

ΔΕΚΑΕΞΑΔΙΚΗ ΥΠΟΓΡΑΦΗ (OFFSET 0):

3E

ΑΝΑΠΑΡΑΣΤΑΣΗ ASCII: >

Τυποποίηση: Bioinformatics de facto global standard

Τεχνικές Προδιαγραφές

Αρχιτεκτονική ΠεριέκτηPlaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes
ΣυμπίεσηUncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz)
Endianness ByteASCII / UTF-8 text stream
Χρωματικοί ΧώροιN/A (Genomic Sequence Data)
Κανάλια & ΔομήNucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes
Μέγιστες ΔιαστάσειςUnbounded sequence length (supports entire human chromosomes over 250 million base pairs)
ΔιαφάνειαNone
Streaming & Προοδευτική ΦόρτωσηSequential record-by-record streaming processing

Τεχνικός Πίνακας Σύγκρισης: FASTA έναντι Ανταγωνιστών

Τεχνικό χαρακτηριστικόFASTA (Τρέχον)FASTQGENBANKGFF
Βαθμολογίες ΠοιότηταςΚαμία (καθαρά γράμματα ακολουθίας)Βαθμολογίες ποιότητας Phred ανά βάσηΚαμία (σχολιασμοί χαρακτηριστικών)Καμία (συντεταγμένες χαρακτηριστικών)
Γραμμή ΕπικεφαλίδαςΞεκινά με τον χαρακτήρα '>'Ξεκινά με τον χαρακτήρα '@'Δομημένο μπλοκ LOCUSΓονιδιωματικές στήλες οριοθετημένες με στηλοθέτη (tab)
Κύρια ΧρήσηΓονιδιώματα αναφοράς & αναζήτηση BLASTΑκατέργαστοι αλληλουχητές υψηλής απόδοσης (Illumina)Πλήρη σχολιασμένα γονίδιαΣχολιασμοί γονιδιωματικών χαρακτηριστικών
Μέγεθος Αρχείου (Ανθρώπινο)~3 Gigabyte συμπιεσμένα~100+ Gigabyte (με ποιότητες)Πλούσιο κείμενο πολλών gigabyte~50 Megabyte

Συνηθισμένοι Τρόποι Διαφθοράς & Οδηγός Ανάκτησης Hex

Το εργαλείο βιοinformatics αναφέρει 'Μη έγκυρος χαρακτήρας ακολουθίας στη γραμμή X'.

Βασική Αιτία: Κενοί χαρακτήρες, αριθμοί ή μη χαρακτήρες IUPAC μέσα στις γραμμές ακολουθίας.

Ανάκτηση: Φιλτράρισμα και καθαρισμός χαρακτήρων ακολουθίας χρησιμοποιώντας το File2File Bioinformatics Tool.

Ανάλυση Ασφάλειας & Διανύσματα Επίθεσης Parser

Τα εργαλεία γονιδιωματικής αναλύουν τεράστια αρχεία FASTA πολλών gigabyte όπου μπορεί να προκύψουν υπερχειλίσεις ακεραίων κατά την ευρετηρίαση συντεταγμένων ακολουθίας.

Γνωστά διανύσματα επίθεσης

  • Υπερχείλιση ακεραίων σε ευρετηριαστές ακολουθιών 32-bit (FAI) που υπερβαίνουν τα 2^31 ζεύγη βάσεων.
  • Υπερχείλιση buffer κατά την ανάγνωση υπερβολικά μακρών επικεφαλίδων αναγνωριστικών ακολουθίας.
  • Άρνηση υπηρεσίας μέσω παθολογικών ερωτημάτων ευθυγράμμισης.

Βέλτιστες αμυντικές πρακτικές:

Ιστορική Αναδρομή & Ορόσημα

2003Το Πρόγραμμα Ανθρώπινου Γονιδιώματος ολοκληρώνει την πρώτη αλληλουχία του ανθρώπινου γονιδιώματος, δημοσιεύοντας αποτελέσματα σε μορφή FASTA.
1990Το BLAST (Basic Local Alignment Search Tool) υιοθετεί το FASTA ως την τυπική μορφή εισόδου του.
1985Ο William Pearson και ο David Lipman εισάγουν το FASTA με το λογισμικό ευθυγράμμισης ακολουθιών FASTP.

Κύρια Πλεονεκτήματα

  • Το αδιαμφισβήτητο παγκόσμιο πρότυπο της υπολογιστικής βιολογίας: χρησιμοποιείται από κάθε γονιδιωματικό εργαλείο, αλληλουχητή και βάση δεδομένων στη Γη.
  • Ακραία απλότητα: η γραμμή 1 ξεκινά με '>' ακολουθούμενη από ένα ID, ακολουθούμενη από γενετικά γράμματα απλού κειμένου.
  • Χωρητικότητα πολλαπλών ακολουθιών: ένα ενιαίο αρχείο μπορεί να περιέχει χιλιάδες μεμονωμένα γονίδια ή πλήρη ιογενή γονιδιώματα.

Τεχνικοί Περιορισμοί & Μειονεκτήματα

  • Δεν περιέχει βαθμολογίες ποιότητας αλληλουχίας (σε αντίθεση με το FASTQ, το οποίο αποθηκεύει βαθμολογίες εμπιστοσύνης Phred ανά βάση).
  • Χωρίς τυποποιημένη σύνταξη μεταδεδομένων για γραμμές επικεφαλίδας πέρα από το αρχικό αναγνωριστικό.
  • Τεράστιο αποτύπωμα αποθήκευσης για σύνολα δεδομένων ολόκληρου του γονιδιώματος χωρίς Gzip ή εξειδικευμένη γονιδιωματική συμπίεση.

Ενδιαφέροντα Τεχνικά Στοιχεία

  • Ολόκληρο το ανθρώπινο γονιδίωμα 3 δισεκατομμυρίων ζευγαριών βάσεων μπορεί να αναπαρασταθεί σε μορφή FASTA, καταλαμβάνοντας περίπου 3 gigabyte αποθηκευτικού χώρου.
  • Τα τέσσερα γράμματα του DNA που αποθηκεύονται σε αρχεία FASTA είναι τα A (Αδενίνη), C (Κυτοσίνη), G (Γουανίνη) και T (Θυμίνη).
  • Όταν το γονιδίωμα του κορωνοϊού COVID-19 αλληλουχίστηκε για πρώτη φορά τον Ιανουάριο του 2020, οι επιστήμονες το μοιράστηκαν παγκοσμίως ως αρχείο FASTA 30.000 γραμμάτων.

Συχνές Τεχνικές Ερωτήσεις

Τι είναι ένα αρχείο FASTA;

Ένα αρχείο FASTA είναι ένα αρχείο απλού κειμένου που χρησιμοποιείται στη βιολογία για την αποθήκευση ακολουθιών DNA, RNA ή πρωτεϊνών με χρήση συντομογραφιών ενός γράμματος.

Πια είναι η διαφορά μεταξύ FASTA και FASTQ;

Το FASTA αποθηκεύει μόνο τα γράμματα της γενετικής ακολουθίας, ενώ το FASTQ αποθηκεύει τόσο τα γράμματα όσο και τη βαθμολογία ποιότητας ακριβίας αλληλούχισης για κάθε βάση.

Πώς μπορώ να δω ένα αρχείο FASTA;

Μπορείτε να ανοίξετε αρχεία FASTA σε οποιονδήποτε επεξεργαστή κειμένου, να τα προβάλετε σε λογισμικό βιοπληροφορικής όπως το Jalview ή το UGENE, ή να τα μετατρέψετε χρησιμοποιώντας το File2File.app.