FASTA-sekvens (.fasta)
Bioinformatics StandardFASTA är bioinformatikens och genomikens allestädes närvarande grundläggande filformat som representerar nukleotidsekvenser (DNA, RNA) och aminosyrasekvenser med universella enbokstavskoder.
Konvertera FASTA till GENBANK
Gratis konverterare från FASTA till GENBANK i webbläsaren. Konvertera filer direkt på din enhet.
Granska & Metadata
Operativsystem och filanalysverktyg identifierar FASTA-filer genom att granska den inledande binära bytesekvensen:
Signatur för filhuvud på bytenivå (Magic Bytes)
Operativsystem och filanalysverktyg identifierar FASTA-filer genom att granska den inledande binära bytesekvensen:
HEX-SIGNATUR (OFFSET 0):
3EASCII-REPRESENTATION: >
Standardisering: Bioinformatics de facto global standard
Tekniska specifikationer
| Containerarkitektur | Plaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes |
| Komprimering | Uncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz) |
| Bytessordinning | ASCII / UTF-8 text stream |
| Färgrymder | N/A (Genomic Sequence Data) |
| Kanaler och struktur | Nucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes |
| Maximala dimensioner | Unbounded sequence length (supports entire human chromosomes over 250 million base pairs) |
| Transparens | None |
| Strömning och progressiv | Sequential record-by-record streaming processing |
Teknisk jämförelsematris: FASTA vs konkurrenter
| Tekniskt attribut | FASTA (Aktuell) | FASTQ | GENBANK | GFF |
|---|---|---|---|---|
| Kvalitetspoäng | Inga (rena sekvensbokstäver) | Phred-kvalitetspoäng per bas | Inga (funktionsanteckningar) | Inga (funktionskoordinater) |
| Huvudrad | Börjar med tecknet '>' | Börjar med tecknet '@' | Strukturerat LOCUS-block | Tabelldelade genomiska kolumner |
| Primär användning | Referensgenom och BLAST-sökning | Råa högt genomströmmande sekvenserare (Illumina) | Omfattande annoterade gener | Genomiska funktionsanteckningar |
| Filstorlek (Människa) | ~3 gigabyte okomprimerat | ~100+ gigabyte (med egenskaper) | Rik text på flera gigabyte | ~50 megabyte |
Vanliga skadeorsaker och hex-återställningsguide
Bioinformatikverktyget rapporterar 'Ogiltigt sekvenstecken på rad X'.
Grundorsak: Mellanslag, siffror eller icke-IUPAC-tecken inuti sekvensraderna.
Återställning: Filtrera och rensa sekvenstecken med File2File Bioinformatics Tool.
Säkerhetsanalys och attackvektorer för tolkar
Genomikverktyg tolkar massiva FASTA-filer på flera gigabyte där heltalsspill kan inträffa vid indexering av sekvenskoordinater.
Kända attackvektorer
- Heltalsspill i 32-bitars sekvensindexerare (FAI) som överstiger 2^31 baspar.
- Buffertspill vid läsning av alltför långa huvuden för sekvensidentifierare.
- Tjänstenekad (DoS) genom patologiska inriktningsfrågor.
Rekommenderade skyddsåtgärder:
Historiskt ursprung och milstolpar
Viktiga fördelar
- Den ohotade globala standarden för beräkningsbiologi: används av alla genomiska verktyg, sekvenserare och databaser på jorden.
- Extrem enkelhet: rad 1 börjar med '>' följt av ett ID, följt av genetiska bokstäver i ren text.
- Kapacitet för flera sekvenser: en enda fil kan innehålla tusentals enskilda gener eller fullständiga virusgenom.
Tekniska begränsningar
- Innehåller inga sekvenseringskvalitetspoäng (till skillnad från FASTQ, som lagrar Phred-förtroendepoäng per bas).
- Ingen standardiserad metadatasyntax för huvudrader utöver den ursprungliga identifieraren.
- Enormt lagringsutrymme för helgenomdatauppsättningar utan Gzip eller specialiserad genomisk komprimering.
Intressant teknisk kuriosa
- Hela det mänskliga genomet på 3 miljarder baspar kan representeras i FASTA-format och tar ungefär 3 gigabyte lagringsutrymme.
- De fyra DNA-bokstäverna som lagras i FASTA-filer är A (Adenin), C (Cytosin), G (Guanin) och T (Tymin).
- När covid-19-coronavirusets genom sekvenserades för första gången i januari 2020 delade forskare det globalt som en 30 000 bokstäver lång FASTA-fil.
Vanliga tekniska frågor
Vad är en FASTA-fil?
En FASTA-fil är en ren textfil som används inom biologi för att lagra DNA-, RNA- eller proteinsekvenser med enbokstavsförkortningar.
Vad är skillnaden mellan FASTA och FASTQ?
FASTA lagrar enbart de genetiska sekvensbokstäverna, medan FASTQ lagrar både bokstäverna och en kvalitetspoäng för sekvenseringsnoggrannheten för varje bas.
Hur kan jag visa en FASTA-fil?
Du kan öppna FASTA-filer i vilken textredigerare som helst, visa dem i bioinformatikprogram som Jalview eller UGENE, eller konvertera dem med File2File.app.
Relaterade konverteringspar för FASTA
Att konvertera en vanlig FASTA-sekvens till en GenBank-platfil lägger till väsentliga biologiska anmärkningar och metadata till den råa genetiska koden.
Att konvertera en GenBank-platfil till en FASTA-sekvens rensar bort anmärkningsmetadata för att endast lämna de råa nukleotid- eller aminosyreserierna som behövs för snabb bioinformatikanalys.