FASTA-Sequenz (.fasta)

Bioinformatics Standard

FASTA ist das ubiquitäre, grundlegende Dateiformat der Bioinformatik und Genomik, das Nukleotidsequenzen (DNA, RNA) sowie Aminosäure-Proteinsequenzen mittels universeller Einbuchstabencodes darstellt.

Von FASTA zu GENBANK konvertieren

Kostenloser Konverter von FASTA zu GENBANK im Browser. Konvertieren Sie Dateien sofort auf Ihrem Gerät.

Untersuchen & Metadaten

Betriebssysteme und Dateianalysatoren identifizieren FASTA-Dateien durch Untersuchung der führenden binären Byte-Sequenz:

Dateien auswählen oder hierher ziehen

100 % private Konvertierung im Browser - Dateien verlassen niemals Ihr Gerät

oder einfügen Strg+V
Datenschutzgarantie ohne Netzwerkübertragung: 0 Bytes an externe Server hochgeladen. Die gesamte Verarbeitung erfolgt lokal in Ihrer Browser-Sandbox.

Byte-basierte Headersignatur (Magic Bytes)

Betriebssysteme und Dateianalysatoren identifizieren FASTA-Dateien durch Untersuchung der führenden binären Byte-Sequenz:

HEX-SIGNATUR (OFFSET 0):

3E

ASCII-DARSTELLUNG: >

Standardisierung: Bioinformatics de facto global standard

Technische Daten

Container-ArchitekturPlaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes
KompressionUncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz)
Byte-EndiannessASCII / UTF-8 text stream
FarbräumeN/A (Genomic Sequence Data)
Kanäle & StrukturNucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes
Max. AbmessungenUnbounded sequence length (supports entire human chromosomes over 250 million base pairs)
TransparenzNone
Streaming & ProgressivSequential record-by-record streaming processing

Technischer Vergleich: FASTA im Vergleich zu Wettbewerbern

Technisches AttributFASTA (Aktuell)FASTQGENBANKGFF
QualitätswerteKeine (reine Sequenzbuchstaben)Phred-Qualitätswerte pro BaseKeine (Merkmalsannotationen)Keine (Merkmalskoordinaten)
KopfzeileBeginnt mit dem Zeichen '>'Beginnt mit dem Zeichen '@'Strukturierter LOCUS-BlockTabulatorgetrennte Genomspalten
Primäre VerwendungReferenzgenome & BLAST-SucheRohdaten von Hochdurchsatz-Sequenzierern (Illumina)Umfassend annotierte GeneGenomische Merkmalsannotationen
Dateigröße (Mensch)~3 Gigabyte unkomprimiert~100+ Gigabyte (mit Qualitäten)Mehrgigabyte-Rich-Text~50 Megabyte

Häufige Korruptionsarten & Hex-Wiederherstellungsleitfaden

Bioinformatik-Tool meldet 'Ungültiges Sequenzzeichen in Zeile X'.

Ursache: Leerzeichen, Zahlen oder Nicht-IUPAC-Zeichen innerhalb der Sequenzzeilen.

Wiederherstellung: Sequenzzeichen mit dem File2File Bioinformatik-Tool filtern und bereinigen.

Sicherheitsanalyse & Parser-Angriffsvektore

Genomik-Tools verarbeiten massiv große Multi-Gigabyte-FASTA-Dateien, bei denen Ganzzahlüberläufe beim Indizieren von Sequenzkoordinaten auftreten können.

Bekannte Angriffsvektore

  • Ganzzahlüberlauf in 32-Bit-Sequenzindizierern (FAI), die 2^31 Basenpaare überschreiten.
  • Pufferüberlauf beim Lesen übermäßig langer Sequenzidentifikator-Kopfzeilen.
  • Denial-of-Service durch pathologische Alignment-Abfragen.

Bewährte Sicherheitsverfahren:

Historische Ursprünge & Meilensteine

2003Das Humangenomprojekt schließt die erste Sequenzierung des menschlichen Genoms ab und veröffentlicht die Ergebnisse im FASTA-Format.
1990BLAST (Basic Local Alignment Search Tool) übernimmt FASTA als Standard-Eingabeformat.
1985William Pearson und David Lipman führen FASTA mit der FASTP-Sequenzalignment-Software ein.

Hauptvorteile & Stärken

  • Der unbestrittene globale Standard der Computerbiologie: verwendet von jedem Genom-Tool, Sequenzierer und jeder Datenbank weltweit.
  • Extreme Einfachheit: Zeile 1 beginnt mit '>' gefolgt von einer ID, gefolgt von genetischen Buchstaben im Klartext.
  • Multi-Sequenz-Kapazität: Eine einzige Datei kann Tausende einzelner Gene oder vollständige virale Genome enthalten.

Technische Einschränkungen & Nachteile

  • Enthält keine Sequenzierungs-Qualitätswerte (im Gegensatz zu FASTQ, das Phred-Konfidenzwerte pro Base speichert).
  • Keine standardisierte Metadatensyntax für Kopfzeilen über den initialen Identifikator hinaus.
  • Enormer Speicherbedarf für Gesamtgenom-Datensätze ohne Gzip oder spezialisierte Genomkomprimierung.

Interessante technische Wissenswertes

  • Das gesamte menschliche Genom mit 3 Milliarden Basenpaaren kann im FASTA-Format dargestellt werden und benötigt etwa 3 Gigabyte Speicherplatz.
  • Die vier in FASTA-Dateien gespeicherten DNA-Buchstaben sind A (Adenin), C (Cytosin), G (Guanin) und T (Thymin).
  • Als das Genom des COVID-19-Coronavirus im Januar 2020 erstmals sequenziert wurde, teilten es Wissenschaftler weltweit als 30.000 Buchstaben lange FASTA-Datei.

Häufig gestellte technische Fragen

Was ist eine FASTA-Datei?

Eine FASTA-Datei ist eine einfache Textdatei, die in der Biologie verwendet wird, um DNA-, RNA- oder Proteinsequenzen mithilfe von Ein-Buchstaben-Abkürzungen zu speichern.

Was ist der Unterschied zwischen FASTA und FASTQ?

FASTA speichert nur die Buchstaben der genetischen Sequenz, während FASTQ sowohl die Buchstaben als auch den Qualitätswert der Sequenzierungsgenauigkeit für jede Base speichert.

Wie kann ich eine FASTA-Datei anzeigen?

Sie können FASTA-Dateien in jedem Texteditor öffnen, sie in Bioinformatik-Software wie Jalview oder UGENE anzeigen oder sie mit File2File.app konvertieren.