Le grand large

La mer de données

Toutes les technologies de ce hub - SQL, NoSQL, cloud, datalakes - ne sont que des bateaux et des instruments. Voici l'océan qu'ils servent à naviguer, et la bonne nouvelle : tu sais déjà nager.

Un océan qui double tous les deux ans

Chaque seconde, l'humanité fabrique des données : une vidéo téléversée, un capteur météo qui relève la température, un télescope qui photographie le ciel, une carte de transport qu'on tape. Mises bout à bout, ces données forment ce qu'on appelle la datasphère - et elle grossit à une vitesse vertigineuse.

Pour mesurer cet océan, les unités habituelles explosent. On compte en zettaoctets :

# Monter l'échelle, un facteur 1000 à la fois 1 kilooctet (Ko) = mille octets # un courriel 1 mégaoctet (Mo) = mille Ko # une chanson 1 gigaoctet (Go) = mille Mo # un film 1 téraoctet (To) = mille Go # un disque dur 1 pétaoctet (Po) = mille To # une grande science (le CERN) 1 exaoctet (Eo) = mille Po 1 zettaoctet (Zo) = mille Eo = mille milliards de Go

En 2023, la datasphère mondiale pesait environ 120 zettaoctets; elle a depuis franchi les 180 et continue de gonfler. Personne ne peut « lire » tout ça : il faut des machines pour ranger, filtrer et retrouver. C'est exactement le rôle des technologies des huit autres cases.

Pourquoi ça déborde
Trois moteurs gonflent l'océan : les capteurs (chaque objet connecté mesure et enregistre), le multimédia (images et vidéos, très lourdes), et la science (un seul télescope moderne crache plus de données en une nuit qu'une bibliothèque entière).

Où plonger : les ports d'eau libre

La plus belle partie de cet océan est ouverte et gratuite. Des gouvernements, des laboratoires et des musées publient leurs données pour que tout le monde puisse les explorer. Voici quelques quais où amarrer ton calepin Python :

▶ Le catalogue complet des vraies sources du cours

Tu sais déjà nager

Devant un océan de 120 zettaoctets, on pourrait se sentir minuscule. Mais voici le secret : on n'avale jamais la mer d'un coup. On y plonge un seau. Et ce seau, tu sais déjà le remplir avec ce que le cours t'a appris :

# Puiser une goutte de l'océan, avec les outils que tu connais déjà import pandas as pd # Lire un fichier ouvert publié quelque part dans la mer mesures = pd.read_csv("https://exemple.org/temperatures.csv") # Garder seulement ce qui nous intéresse, puis résumer mesuresChaudes = mesures[mesures["temperature"] > 30] print(mesuresChaudes["temperature"].mean())

Un read_csv, un filtre, une moyenne : tu viens de fouiller une donnée réelle tirée de la datasphère. Chaque technologie des huit autres cases n'est qu'un bateau différent pour aller plus loin ou transporter plus lourd - mais le geste de plonger reste le même.

La carte en une phrase
SQL pour les relations solides, NoSQL pour la souplesse, le web sémantique pour le sens, les bases fichiers pour la simplicité, les services pour faire voyager, la blockchain pour la confiance, le cloud et les datalakes pour l'échelle. Neuf cases, un seul océan. À toi de choisir ta traversée.
▶ Revoir toutes les technologies de données