Vocabulaire pour la programmation (non exhaustif)
Conditions d’achèvement
Vocabulaire Python et données textuelles
Écrire et exécuter du Python
| Terme | Définition | Exemple | Pourquoi c’est utile |
|---|---|---|---|
| Notebook | Document mêlant cellules de texte et cellules de code. | Une cellule charge un corpus, la suivante commente les résultats. | Conserver ensemble calculs, résultats et interprétation. |
| Cellule | Unité exécutable ou explicative d’un notebook. | len(texte.split()) dans une cellule de code. |
Tester une étape du traitement sans relancer tout le projet. |
| Instruction | Action demandée à Python. | tokens = texte.split() |
Transformer ou stocker une donnée. |
| Expression | Combinaison qui produit une valeur. | len(tokens) / len(set(tokens)) |
Calculer un indicateur à partir d’un corpus. |
| Commentaire | Texte précédé de #, ignoré par Python. |
# nombre de tokens du document |
Expliquer l’intention du code. |
| Erreur de syntaxe | Code que Python ne peut pas analyser. | Si on oublie : à la fin d’un if |
Repérer un problème avant même le traitement des données (Python n’interpète pas les énoncés mal formés ou ambigües). |
| Erreur de type | On réalise une opération impossible (ou ambigüe) sur un type de variables | 4+“4”+2 est-ce que j’attends 10 ou “4 4 2” comme dans le dispositif tactique au foot | Ne pas forcer un résultat. |
| Indentation | Espaces qui délimitent les blocs Python (boucles et conditions par exemple). | La série d’instructions quand un if est vrai. | Indiquer quelles actions doivent être répétées ou conditionnelles et quand on “désindente” lesquelles n’en font plus partie |
Variables, valeurs et types
| Terme | Définition | Exemple | Pourquoi c’est utile |
|---|---|---|---|
| Variable | Nom associé à une valeur (texte dans l’exemple ci-après). | texte = "Un petit corpus" |
Réutiliser un texte ou un résultat sans le recopier. |
| Affectation | Association entre un nom (identifiant) de variable et sa valeur réalisée avec =. |
langue = "fr" |
Mémoriser une métadonnée ou le résultat d’un calcul. |
| Identifiant | Nom choisi pour une variable, une fonction ou un module. | nombre_tokens |
Donner au programme un vocabulaire lisible, expliciter. |
| Valeur | Contenu manipulé par le programme. | "fr", 2026, True |
Représenter textes, dates, catégories et états. |
| Type | Nature d’une valeur et opérations autorisées. | str pour le texte, int pour l’année. |
Éviter d’additionner par erreur "20" et 5, fréquent après lecture d’un CSV. |
Chaîne (str) |
Suite de caractères. | "analyse de corpus" |
Stocker et transformer le contenu textuel. |
Entier (int) |
Nombre entier. | nombre_tokens = 354 |
Compter documents, tokens ou occurrences. |
Booléen (bool) |
Valeur True ou False. |
est_vide = texte.strip() == "" |
Filtrer des documents selon un critère. |
| Conversion/Transtypage | Passage d’un type à un autre. | age = int(ligne["age"]) |
Rendre calculables les nombres lus comme chaînes dans un CSV. |
| Opération | Transformation symbolisée par un opérateur. | L’addition symbolisée par +, dans 3 + 5 le résultat de l’opération d’addition est 8 |
Définir ce que l’on fait avec les données. |
| Opérateur | Symbole réalisant une opération. | +, /, ==, in sont des opérateurs |
Calculer, comparer ou tester une présence. |
| Opérandes | Données sur lesquelles l’opération est réalisée. | Dans 3 + 5 , les opérandes sont 3 et 5 |
Définir ce sur quoi on travaille. |
| Concaténation | Opération consistant à coller des chaînes de caractères. | “3” + “5” donne donc “35” | Fabriquer des phrases à partir de mots, des paragraphes à partir de phrases … |
Contrôler le traitement
| Terme | Définition | Exemple | Pourquoi c’est utile |
|---|---|---|---|
| Condition | Test exécutant un bloc si une expression est vraie. | if langue == "fr": |
Ne traiter que les documents pertinents. |
| Comparaison | Test entre deux valeurs. | len(tokens) >= 100 |
Repérer des textes suffisamment longs. |
Boucle for |
Répétition sur les éléments d’un objet. | for document in corpus: |
Appliquer le même traitement à 10 ou 10 000 documents. |
Boucle while |
Répétition tant qu’une condition reste vraie. | Lire des lots tant qu’il reste une page d’API. | Gérer un nombre d’étapes inconnu à l’avance. |
| Itérable | Objet que l’on peut parcourir. | liste de textes, clés d’un dictionnaire, lignes d’un fichier. | Fournir les éléments successifs d’une boucle. |
| Compteur | Variable augmentée à chaque occurrence. | nombre_vides += 1 |
Quantifier un phénomène. |
| Accumulateur | Variable recueillant progressivement un résultat. | total_mots += len(tokens) |
Calculer un total ou construire une collection. |
| Filtrage | Conservation des éléments qui respectent un critère. | garder les textes français non vides. | Constituer un sous-corpus cohérent. |
Structures de données
| Terme | Définition | Exemple | Pourquoi c’est utile |
|---|---|---|---|
Liste (list) |
Collection ordonnée et modifiable. | tokens = [“toto”, “titi”, “tutu”, “tutu”] | Conserver l’ordre et les répétitions. |
Tuple (tuple) |
Collection ordonnée non modifiable. | (2026, 09, 09) |
Représenter un petit groupe de valeurs stable. |
Ensemble (set) |
Collection sans doublon. | set(tokens) -> {“toto”, “titi”, “tutu” |
Construire le vocabulaire d’un texte. |
Dictionnaire (dict) |
Association clé → valeur. | {"texte": ..., "langue": "fr"} |
Associer un document à ses métadonnées ou un mot à sa fréquence. |
| Clé | Identifiant d’une entrée de dictionnaire. | "langue" |
Retrouver une métadonnée par son nom. |
| Valeur de dictionnaire | Donnée associée à une clé. | document["langue"] vaut "fr". |
Lire ou modifier l’information voulue. |
| Structure imbriquée | Collection contenant d’autres collections. | liste de dictionnaires | Représenter des données riches et hiérarchiques. |
| Mutable | Objet modifiable après sa création. | liste ou dictionnaire. | Ajouter progressivement des résultats. |
| Immuable | Objet non modifiable “sur place”. | tuple. | Comprendre pourquoi certaines méthodes créent une nouvelle valeur. |
| Compréhension | Syntaxe compacte de construction d’une collection. | [len(t.split()) for t in textes] |
Transformer un corpus de façon concise, optimiser le temps de calcul. |
Fonctions et robustesse
| Terme | Définition | Exemple | Pourquoi c’est utile |
|---|---|---|---|
| Fonction | Bloc réutilisable défini avec def. |
nettoyer_texte(texte) |
Appliquer exactement le même traitement à tous les documents. |
| Paramètre | Nom prévu dans la définition d’une fonction. | texte dans def tokeniser(texte): |
Décrire les données attendues par la fonction. |
| Argument | Valeur fournie lors de l’appel. | tokeniser(document["texte"]) |
Utiliser la fonction sur un document concret. |
| Valeur par défaut | Valeur utilisée si l’argument est omis. | minuscules=True |
Proposer un comportement habituel mais modifiable. |
return |
Renvoie le résultat d’une fonction. | return tokens |
Récupérer les données transformées pour la suite du pipeline. |
| Exception | Erreur survenant pendant l’exécution. | ValueError pour int("inconnu"). |
Détecter proprement les métadonnées invalides. |
try / except |
Interception contrôlée d’une exception. | ignorer un âge non convertible en conservant le document. | Empêcher qu’une cellule invalide bloque tout le corpus. |
Assertion (assert) |
Vérification qui doit être vraie. | assert tokeniser("Un mot") == ["un", "mot"] |
Vérifier rapidement qu’une fonction se comporte comme prévu. |
Modules, fichiers et formats
| Terme | Définition | Exemple | Pourquoi c’est utile |
|---|---|---|---|
| Module | Fichier ou composant Python importable. | csv, json, statistics. |
Réutiliser du code déjà testé. |
| Bibliothèque | Ensemble de modules spécialisés. | pandas, Seaborn, Matplotlib. | Manipuler ou visualiser les données avec des outils adaptés. |
| Import | Chargement d’un module. | from pathlib import Path |
Rendre ses fonctions disponibles dans le notebook. |
| Chemin | Localisation d’un fichier ou dossier. | Path("donnees") / "corpus" |
Trouver les données de manière portable. |
| Fichier | Données conservées sur disque. | un texte UTF-8 ou un tableau CSV. | Retrouver et partager un corpus entre plusieurs sessions. |
| Encodage | Correspondance entre octets et caractères. | encoding="utf-8" |
Lire correctement accents, apostrophes et caractères non ASCII. |
| Gestionnaire de contexte | Construction with qui libère une ressource. |
with open(...) as fichier: |
Fermer le fichier même si une erreur survient. |
| CSV | Format tabulaire en texte brut. | une ligne par étudiant, une colonne par variable. | Échanger des données rectangulaires. |
| JSON | Format représentant listes, dictionnaires et imbrications. | médiathèque avec documents et auteurs. | Conserver une structure plus riche qu’un tableau. |
Distinctions importantes
=affecte une valeur ;==compare deux valeurs.- un token est une occurrence ; un type est une forme distincte.
- une liste garde ordre et doublons ; un set ne garde que l’unicité.
print()affiche pour l’humain ;returntransmet un résultat au programme.- CSV convient aux tableaux ; JSON convient aux structures imbriquées.
- la moyenne résume ; la distribution montre la diversité des cas.
Modifié le: mardi 8 septembre 2026, 08:55