Installer SRA Toolkit et télécharger des FASTQ (NCBI SRA)
Installez la boîte à outils sur macOS, Linux ou Windows — puis récupérez des données de séquençage avec prefetch et fasterq-dump
Comment installer le NCBI SRA Toolkit et télécharger des données de séquençage depuis la Short Read Archive. Installez le binaire pour macOS, Linux ou Windows (ou via conda bioconda::sra-tools), configurez-le une fois avec vdb-config, puis téléchargez les lectures avec prefetch et convertissez-les en FASTQ avec fasterq-dump — le remplaçant actuel, plus rapide, de l’ancien fastq-dump.
- Installer le NCBI SRA Toolkit sur macOS, Linux ou Windows — depuis le binaire officiel, ou avec une seule commande conda.
- Configurer l’outil une fois avec
vdb-configpour que les téléchargements atterrissent là où vous l’attendez. - Télécharger n’importe quel run depuis la Short Read Archive avec
prefetch, puis le convertir en FASTQ avecfasterq-dump. - Savoir quel outil utiliser :
fasterq-dumpest l’outil actuel, multithreadé ;fastq-dumpest ancien.
Les données de séquençage publiques sont hébergées dans la Short Read Archive (SRA) — le dépôt du NCBI qui rassemble les lectures brutes derrière presque toutes les études de génomique, de RNA-seq ou de single-cell publiées. Pour réanalyser ces données, vous devez d’abord les récupérer sur votre machine et les obtenir au format FASTQ, le format en texte brut qu’attendent tous les outils d’alignement et de contrôle qualité. Le SRA Toolkit est le logiciel en ligne de commande officiel du NCBI conçu exactement pour cela.
Chaque jeu de données de la SRA possède un numéro d’accession (accession) stable — un run est identifié par un identifiant SRR… (par exemple SRR1282056), regroupé sous une étude SRP… et un projet PRJNA…. Vous fournissez à la boîte à outils un numéro d’accession SRR, et elle récupère les lectures. Ce guide est un tutoriel en ligne de commande (bash) — il n’y a pas de R ici ; chaque bloc ci-dessous est une commande de terminal que vous exécutez vous-même.
Étape 1 — Installer la boîte à outils
Choisissez une des deux méthodes. Si vous gérez déjà vos logiciels de bioinformatique avec conda, utilisez-la — c’est la moins sujette aux erreurs. Sinon, récupérez le binaire précompilé du NCBI.
Option A — conda (recommandé)
La boîte à outils est packagée sur Bioconda sous le nom sra-tools. Avec conda (ou le plus rapide mamba) et le canal Bioconda configuré, une seule commande installe tout et place prefetch, fasterq-dump et vdb-config sur votre PATH :
conda install -c bioconda sra-toolsPréférez un environnement isolé pour que la boîte à outils n’entre pas en conflit avec vos autres outils :
conda create -n sra -c bioconda sra-tools
conda activate sraOption B — binaire officiel du NCBI
Téléchargez la version current correspondant à votre système d’exploitation directement depuis la page de téléchargement du NCBI. Le current dans le nom de fichier pointe toujours vers la dernière version, si bien que ces URL ne deviennent jamais obsolètes :
# Ubuntu / Debian Linux (x86_64)
curl -O https://ftp-trace.ncbi.nlm.nih.gov/sra/sdk/current/sratoolkit.current-ubuntu64.tar.gz
# macOS — Apple Silicon (M1/M2/M3/M4, native ARM64)
curl -O https://ftp-trace.ncbi.nlm.nih.gov/sra/sdk/current/sratoolkit.current-mac-arm64.tar.gz
# macOS — Intel (x86_64)
curl -O https://ftp-trace.ncbi.nlm.nih.gov/sra/sdk/current/sratoolkit.current-mac64.tar.gz
# AlmaLinux / RHEL-family (x86_64)
curl -O https://ftp-trace.ncbi.nlm.nih.gov/sra/sdk/current/sratoolkit.current-alma_linux64.tar.gzSous Windows, téléchargez sratoolkit.current-win64.zip depuis le même dossier et décompressez-le.
Décompressez l’archive tar (Linux/macOS) :
tar -vxzf sratoolkit.current-mac-arm64.tar.gz # substitute the tarball you downloaded (ubuntu64 / mac64 / alma_linux64)Cela crée un dossier versionné tel que sratoolkit.3.4.1-mac-arm64/. Les exécutables se trouvent dans son sous-dossier bin/ — ajoutez-le à votre PATH pour pouvoir appeler les outils depuis n’importe où. Faites pointer le chemin vers le dossier que vous venez d’extraire :
export PATH=$PATH:/full/path/to/sratoolkit.3.4.1-mac-arm64/binPour la rendre permanente, ajoutez cette même ligne export à votre fichier de démarrage de shell — ~/.bashrc (bash) ou ~/.zshrc (le shell par défaut de macOS) — puis ouvrez un nouveau terminal.
Vérifier l’installation
Vérifiez que les outils sont trouvés et affichez une version. Cela fonctionne quelle que soit la méthode choisie :
which fastq-dump
fasterq-dump --versionSi fasterq-dump --version affiche un numéro de version, la boîte à outils est installée.
Étape 2 — Configurer l’outil une fois
La première fois que vous utilisez la boîte à outils, lancez sa configuration interactive pour que les téléchargements et le cache local aillent dans un dossier de votre choix :
vdb-config -iCela ouvre un menu texte. L’essentiel, d’après le guide de configuration du NCBI : sous l’onglet Cache, activez la mise en cache locale des fichiers et définissez l’emplacement du user-repository sur un dossier vide disposant de suffisamment d’espace (les runs de la SRA peuvent peser plusieurs gigaoctets). Enregistrez et quittez. Vous ne faites cela qu’une seule fois par machine.
Étape 3 — Télécharger les données : prefetch puis fasterq-dump
Le workflow moderne tient en deux commandes. D’abord, prefetch télécharge le run et ses dépendances dans un dossier nommé d’après le numéro d’accession :
prefetch SRR1282056Ensuite, fasterq-dump lit ce run téléchargé et écrit les fichiers FASTQ. Exécutez-le dans le même répertoire — il trouve le dossier SRR1282056/ que prefetch vient de créer :
fasterq-dump SRR1282056Par défaut, fasterq-dump effectue une opération split-3 : les données paired-end produisent donc SRR1282056_1.fastq et SRR1282056_2.fastq (lectures forward et reverse), tandis que les données single-end produisent un unique SRR1282056.fastq. C’est le comportement que vous souhaitez presque toujours.
Deux options utiles à connaître sur des données réelles — fasterq-dump est multithreadé, et une barre de progression est rassurante sur un run volumineux :
fasterq-dump SRR1282056 -e 6 -p-e définit le nombre de threads (la valeur par défaut est 6), et -p affiche une barre de progression. Utilisez -O <dir> pour envoyer le FASTQ ailleurs, et -t <dir> pour placer l’espace de travail temporaire sur un disque rapide. Toutes les options figurent dans le guide fasterq-dump du NCBI.
Les fichiers FASTQ sont volumineux et très compressibles — compressez-les avec gzip avant de les stocker ou de les partager :
gzip SRR1282056*.fastqfasterq-dump vs. l’ancien fastq-dump
Vous verrez d’anciens tutoriels (y compris notre propre ancienne page SThDA) recourir à fastq-dump --split-3. Cela fonctionne toujours, mais fasterq-dump est l’outil actuel — il est nettement plus rapide car il utilise plusieurs threads et un espace de travail temporaire, et il applique split-3 par défaut, si bien que vous n’avez plus à passer --split-3 --skip-technical à la main.
Ne gardez fastq-dump en tête que pour les quelques fonctionnalités que fasterq-dump abandonne volontairement : il n’a pas de compression intégrée --gzip/--bzip2, pas de flux -Z/--stdout, ni d’options de plage de spots (-N/-X). Si vous devez transmettre directement le flux à un autre outil ou écrire du gzip en une seule étape, l’ancien fastq-dump est la solution de repli ; pour tout le reste, préférez fasterq-dump.
Problèmes fréquents
command not found: fasterq-dump. Le dossier bin/ n’est pas sur votre PATH. Vérifiez à nouveau que la ligne export PATH=… pointe vers le répertoire sratoolkit.<version>-<os>/bin extrait, et que vous l’avez ajoutée à ~/.bashrc / ~/.zshrc avant d’ouvrir un nouveau terminal. Avec la méthode conda, assurez-vous que l’environnement est activé (conda activate sra).
fasterq-dump échoue ou se bloque au premier lancement. Vous avez sauté la configuration. Lancez vdb-config -i une fois et définissez un emplacement de cache valide — sans cela, la boîte à outils n’a nulle part où écrire.
« Exec format error » sur un Mac Apple Silicon. Vous avez téléchargé la version Intel (mac64) et l’avez exécutée sur un Mac de la série M. Récupérez plutôt la version native Apple Silicon — sratoolkit.current-mac-arm64.tar.gz — ou, pour exécuter la version Intel, installez Rosetta 2 avec softwareupdate --install-rosetta.
Un seul fichier FASTQ pour des données paired-end. Vous avez probablement lancé l’ancien fastq-dump sans --split-3, ce qui entrelace les lectures. Relancez avec fasterq-dump (qui sépare par défaut) pour obtenir des fichiers _1/_2 distincts.
Foire aux questions
Un numéro d’accession est l’identifiant stable des données dans la Short Read Archive. Un unique run de séquençage correspond à un identifiant SRR… ; les runs sont regroupés sous une étude (SRP…), un BioProject (PRJNA…) et un échantillon (SRS…). Vous les trouvez sur la page NCBI SRA ou GEO de l’étude, ou dans la déclaration de disponibilité des données de l’article. Vous transmettez l’identifiant SRR à prefetch.
prefetch, ou puis-je exécuter fasterq-dump seul ?
fasterq-dump SRR… peut télécharger et convertir en une seule étape, mais le NCBI recommande le workflow en deux temps prefetch puis fasterq-dump. prefetch télécharge de manière plus fiable (il reprend et vérifie), et fasterq-dump travaille ensuite à partir de la copie locale — c’est bien plus rapide et plus respectueux des serveurs, surtout pour des runs volumineux ou nombreux.
fasterq-dump et fastq-dump ?
fasterq-dump est l’outil actuel : multithreadé, plus rapide, et il sépare les lectures paired-end (split-3) par défaut. fastq-dump est l’outil ancien — plus lent et monothread — conservé uniquement pour les fonctionnalités que fasterq-dump abandonne, comme la compression intégrée --gzip et le flux -Z/--stdout. Pour une extraction FASTQ courante, utilisez fasterq-dump.
Le NCBI fournit une version native Apple Silicon — téléchargez sratoolkit.current-mac-arm64.tar.gz (et non la version Intel mac64) et elle s’exécute nativement sur les Mac M1/M2/M3/M4. Seule la version Intel nécessite Rosetta 2 (softwareupdate --install-rosetta). La méthode conda (conda install -c bioconda sra-tools) résout elle aussi la bonne version pour vous.
prefetch écrit à l’emplacement du user-repository que vous avez défini dans vdb-config -i (onglet Cache). fasterq-dump écrit le FASTQ dans le répertoire courant par défaut ; utilisez -O <dir> pour choisir un autre dossier de sortie et -t <dir> pour placer son espace de travail temporaire sur un disque rapide.
Conclusion
Installer le SRA Toolkit est une opération unique — récupérez le binaire ou lancez conda install -c bioconda sra-tools, exécutez vdb-config -i une fois — après quoi récupérer n’importe quel jeu de données public se résume à prefetch SRR… puis fasterq-dump SRR…. Utilisez fasterq-dump par défaut et ne gardez l’ancien fastq-dump que pour les cas particuliers de gzip/stdout.
Une fois le FASTQ en main, les étapes suivantes sont le contrôle qualité et l’alignement. Commencez par l’introduction aux formats de fichiers en bioinformatique pour comprendre ce que contient un enregistrement FASTQ, puis suivez le pilier Bioinformatique avec R jusqu’à l’analyse RNA-seq avec DESeq2.
Sur le même thème : Bioinformatique avec R · Catégorie : Bioinformatique
Citation
@online{kassambara2026,
author = {Kassambara, Alboukadel},
title = {Installer SRA Toolkit et télécharger des FASTQ (NCBI SRA)},
date = {2026-07-13},
url = {https://www.datanovia.com/blog/install-sra-toolkit},
langid = {fr}
}