/content! : parler à Linux depuis Colab| Préfixe | Sert à |
|---|---|
| (rien) | du code Python normal |
| ! | une commande Linux (shell) |
| % | une commande magique Colab (ex. %cd) |
Dans une cellule Colab, ! exécute une commande Linux au lieu de Python. C'est la clé pour télécharger, dézipper et installer directement depuis le carnet.
!wgetwget télécharge un fichier accessible par une URL dans /content. Les jeux de données arrivent souvent en archive (.tar.gz, .tgz) : on les décompresse ensuite avec tar -xzvf.
!curlcurl -L suit les redirections et enregistre le téléchargement dans un fichier (> data.zip). Pratique pour les exports d'outils comme Roboflow. On dézippe puis on efface l'archive pour gagner de la place.
Deux façons d'extraire une archive zip : la commande Linux !unzip, ou le module Python zipfile (utile quand le dézippage fait partie du programme).
!git clonegit clone copie tout le dépôt dans /content. Pour un seul fichier, on prend son lien Raw et un simple wget suffit.
Dépôt privé : le mot de passe ne marche plus (GitHub, 2021). Il faut un token d'accès personnel : git clone https://<TOKEN>@github.com/.... Le plus simple reste un dépôt public si les données ne sont pas confidentielles.
Beaucoup de projets d'IA se déploient en trois gestes : cloner le dépôt, entrer dedans (%cd), puis installer ses dépendances listées dans requirements.txt. On est prêt à entraîner.
drive.mountdrive.mount branche tout ton Drive dans /content/drive : un popup te demande d'autoriser l'accès, et c'est fait. Contrairement à /content (éphémère), le Drive est permanent - parfait pour garder ses données entre deux séances.
(L'ancien module pydrive et le collage d'un « authorization code » ne sont plus nécessaires.)
gdownPour récupérer un fichier Drive partagé sans monter tout le Drive, gdown le télécharge en une ligne à partir de son identifiant (la longue chaîne dans le lien de partage). Bien plus simple que l'ancien pydrive.
kaggle.json (ta clé)kaggle.json dans /contentKaggle s'utilise par une API authentifiée : on récupère d'abord son fichier-clé kaggle.json depuis son compte, qu'on dépose dans Colab. Ne le partage jamais - c'est ton mot de passe.
On installe l'outil, on place la clé au bon endroit (~/.kaggle/) avec les bons droits (chmod 600), puis une seule commande télécharge ET dézippe le jeu de données (--unzip) dans le dossier voulu (-p).
load_datasetLe Hub Hugging Face est devenu la grande bibliothèque de jeux de données en IA. load_dataset("nom") télécharge, met en cache et structure les données en une ligne - texte, images, audio. Incontournable aujourd'hui.
Pas toujours besoin de télécharger un fichier sur le disque : pandas.read_csv accepte une URL comme un chemin local, et requests récupère n'importe quel contenu du web (JSON, texte, binaire).
files.upload()Pour un petit fichier qui est sur ta machine, files.upload() ouvre une fenêtre de sélection et le dépose dans /content. Rapide pour dépanner - mais comme tout /content, c'est éphémère.
| La donnée est... | Outil |
|---|---|
| un fichier sur le web | !wget · !curl · pandas.read_csv(url) |
| un dépôt de code | !git clone |
| dans ton Google Drive | drive.mount · gdown |
| un dataset Kaggle | kaggle datasets download |
| un dataset connu (IA) | datasets.load_dataset |
| sur ton ordinateur | files.upload() |
Le réflexe : d'où vient la donnée ? Chaque source a son outil. Et rappel : tout ce qui atterrit dans /content disparaît au redémarrage - le Drive ou un re-téléchargement garantit de ne rien reperdre.
/content, et affiche les premières lignes