- Faculté
- Faculté des lettres, Section des sciences du langage et de l’information, Université de Lausanne
- Niveau
- Bachelor
- Semestre
- Printemps 2026
- Langue
- Français
- Séances
- 13
- Prérequis
- Aucun, le cours commence par une introduction à R
- Outils
- R, RStudio, Quarto, quanteda, udpipe
Ces travaux pratiques appliquent les méthodes quantitatives à la linguistique de corpus. Chaque séance est accompagnée d’un notebook Quarto, consultable en ligne ou téléchargeable avec ses sources et ses données, et d’une série d’exercices avec son corrigé.
Séance 1 : Introduction à R et RStudio
Date : 18 février 2026
Prise en main de R et de RStudio : types de données, vecteurs, data frames, importation de fichiers CSV et Excel, et premières fonctions.
I. Introduction à R et RStudio : notebook
Séance 2 : Le Tidyverse I
Date : 25 février 2026
Introduction au tidyverse : le pipe, la manipulation de tableaux avec dplyr et leur restructuration avec tidyr, appliquées à un jeu de données sociolinguistiques. Cette séance s’étend sur deux semaines.
Séance 3 : Le Tidyverse II et les statistiques uni- et bi-variées
Date : 11 mars 2026
Suite du tidyverse (jointures, regroupements, résumés), puis statistiques descriptives uni- et bi-variées sur un jeu de données de marqueurs pragmatiques.
III. Le Tidyverse II et les statistiques : notebook
Séance 4 : Les graphiques en R
Date : 18 mars 2026
La grammaire des graphiques avec ggplot2 : histogrammes, boîtes à moustaches, nuages de points, facettes et personnalisation, avec une ouverture sur les graphiques interactifs.
IV. Les graphiques en R : notebook
Séance 5 : Les tests statistiques
Date : 25 mars 2026
Rappel théorique sur les tests d’hypothèses, puis mise en pratique en R des tests classiques (moyennes, proportions, chi-carré, corrélation) sur des données phonétiques et sociolinguistiques.
V. Rappel sur les tests statistiques (slides)
V. Les tests statistiques : notebook
Séance 6 : Traitement des données textuelles
Date : 1er avril 2026
Constituer un corpus en R : lecture de fichiers texte, nettoyage, tokenisation, mots vides et premières statistiques lexicales avec quanteda, sur des articles de presse, des romans de Jules Verne et des programmes politiques.
VI. Traitement des données textuelles : notebook
Séance 7 : Annotations
Date : 15 avril 2026
Lemmatisation et annotation morphosyntaxique automatiques avec udpipe, lecture de corpus au format XML-TEI et passage des annotations vers quanteda. Le modèle de langue français s’obtient avec la commande udpipe_download_model() indiquée dans le notebook.
Séance 8 : Analyses de données textuelles
Date : 22 avril 2026
Analyses lexicométriques : fréquences et spécificités, cooccurrences, lisibilité et nuages de mots, sur les programmes des partis à l’élection présidentielle française de 2017.
VIII. Analyses de données textuelles : notebook
Séance 9 : Analyse factorielle des correspondances
Date : 29 avril 2026
Introduction théorique à l’AFC, puis son application à une table lexicale textes × mots avec FactoMineR, pour cartographier les programmes politiques et leur vocabulaire.
IX. Introduction à l’AFC (slides)
IX. Analyse factorielle des correspondances : notebook
Séance 10 : Régression linéaire
Date : 6 mai 2026
Introduction théorique à la régression, puis régression linéaire simple et multiple en R : variables indicatrices, sélection de modèle et interprétation des coefficients.
X. Introduction à la régression (slides)
X. Régression linéaire : notebook
Séance 11 : Analyse des correspondances multiples
Date : 13 mai 2026
L’ACM pour explorer un questionnaire à variables catégorielles : construction, interprétation des axes et des modalités, sur le jeu de données de marqueurs pragmatiques.
XI. Analyse des correspondances multiples : notebook
Séance 12 : Clustering
Date : 20 mai 2026
Classification hiérarchique et k-means sur des données phonétiques : choix du nombre de groupes, dendrogrammes et validation des partitions.
Séance 13 : Analyse de réseaux
Date : 27 mai 2026
Construire et analyser un réseau avec igraph et ggraph : mesures de centralité, détection de communautés et visualisation, à partir des données sociolinguistiques.
XIII. Analyse de réseaux : notebook