---
type: archive
area: archive
status: archived
date: 2026-05-03
created: 2026-05-03
updated: 1980-01-01
tags:
  - archive
---
#### Map/Reduce Explication
Le modèle de programmation MapReduce divise les tâches en parties plus petites et les distribues pour un traitement parallèle à différents nœuds de calcul. Le final résultat est créé en fusionnant les résultats partiels. 
Les étapes de MapReduce sont :
• Partitionnement des données li initiales.
• Mapper (mapper) les données à une structure de données qui consiste en une clé-valeur
• Regroupement des paires clé-valeur de clés identiques.
• Distribuer (mélanger) et trier (trier) les paires clé-valeur.
• Réduire (réduire) les paires clé-valeur pour obtenir le résultat.
#### Quel type de données stocke le Namenode ?
Il stocke uniquement les métadonnées. Il connaît tous les fichiers et répertoires qui existent dans le cluster HDFS et stocke le nombre de morceaux de fichiers, le nombre des copies et de leurs emplacements (Datanodes).
#### Qu'est-ce que Hive ?
Il s'agit d'un système d'entrepôt de données basé sur Hadoop.
#### Qu'est-ce que HBase ?
Il s'agit d'une base de données orientée colonnes permettant de gérer de très grandes quantités de données dans Clusters Hadoop.
#### Qu'est-ce que Cloudera ?
Cloudera propose une distribution Hadoop facile à déployer et à utiliser.
#### Quel type de données stockent les Datanodes ?
Ils stockent les données utilisateur.

===================
### SQL
Les tables SQL
Le schema SQL
la normalization SQL
La logique de jointure SQL
Intégrité SQL
Transaction SQL
Syntaxe « CRUD SQL »
Performance
Scalabilité horizontal
### NoSQL
Les documents NOSQL
La logique NOSQL
La dénormalisation NOSQL
Pas de jointure dans NOSQL
Nosql data integrity
Transaction NOSQL
CRUD NOSQL
Performance
Scalabilté vertical


![[Pasted image 20231031224027.png]]

### C'est quoi Hadoop ?
est un framework open-source pour stocker et traiter les données volumineuses sur un cluster. Il est utilisé par un grand nombre de contributeurs et utilisateurs. Il a une licence Apache 2.0.

<mark style="background: #FF5582A6;">Pig</mark>: Langage de script
<mark style="background: #FF5582A6;">Hive:</mark> Langage proche de SQL (Hive QL)
<mark style="background: #FF5582A6;">R Connectors</mark>: permet l’accès à HDFS et l’exécution de requêtes Map/Reduce à partir du langage R.
<mark style="background: #FF5582A6;">Mahout</mark>: bibliothèque de machine learning et mathématiques
<mark style="background: #FF5582A6;">Oozie</mark>: permet d’ordonnancer les jobs Map Reduce, en définissant des
workflows
<mark style="background: #FF5582A6;">Hbase</mark> : Base de données NoSQL orientée colonnes
<mark style="background: #FF5582A6;">Impala</mark> (pas représenté dans la figure): Permet le requêtage de données directement à partir de HDFS (ou de Hbase) en utilisant des requêtes Hive SQL
<mark style="background: #FF5582A6;">Sqoop</mark>: Lecture et écriture des données à partir de bases de données externes
<mark style="background: #FF5582A6;">Flume</mark>: Collecte de logs et stockage dans HDFS
<mark style="background: #FF5582A6;">Ambari</mark>: outil pour le provisionnement, gestion et monitoring des clusters
<mark style="background: #FF5582A6;">Zookeeper</mark>: fournit un service centralisé pour maintenir les information de configuration, de nommage et de synchronisation distribuée 

![[Pasted image 20231101070954.png]]

**Block Size:** A file is split into multiple blocks based on the block size (default size is 64MB for Hadoop v1.0 and 128MB for Hadoop v2.0) which are pushed to different Data Nodes. The address of all these blocks is stored on Name Node.  
Q1: How many unique data blocks would there be for a file of size of 5GB  
Ans: (5 GB* 1024 MB) / 64 MB= 80 blocks  
**Assumption**: The block size is 64 MB.

**Replication Factor:** All the blocks of files are replicated based on the replication Factor. Default replication factor is set to 3. So, any data block is present 3 times on the cluster unless changed.  
Q2: How many total blocks (including replicas) of the same file above would be present on the cluster.  
Ans: 80 blocks *3 = 240 blocks  
**Assumption**: The replication factor is 3.

### Explique de principe Map/Reduce

Dans un environnement distribué comme Hadoop HDFS (Hadoop Distributed File System), le principe de MapReduce est un modèle de programmation pour le traitement et la génération de grands ensembles de données. Il comporte deux étapes principales : Map, qui applique une fonction aux données et produit des paires clé-valeur, et Reduce, qui agrège et traite ces paires pour générer des résultats significatifs en parallèle sur un cluster de nœuds, ce qui le rend adapté au traitement et à l'analyse de données volumineuses.