Analyse de données en SHS

Travaux pratiques d’introduction à l’analyse de données en sciences humaines et sociales, appliquée à la linguistique de corpus : R et tidyverse, tests, traitement et annotation de textes, méthodes factorielles, régression, clustering et réseaux.
R
Text Analysis
Data Analysis
Date de publication

18 février 2026

Faculté
Faculté des lettres, Section des sciences du langage et de l’information, Université de Lausanne
Niveau
Bachelor
Semestre
Printemps 2026
Langue
Français
Séances
13
Prérequis
Aucun, le cours commence par une introduction à R
Outils
R, RStudio, Quarto, quanteda, udpipe
Note

Ces travaux pratiques appliquent les méthodes quantitatives à la linguistique de corpus. Chaque séance est accompagnée d’un notebook Quarto, consultable en ligne ou téléchargeable avec ses sources et ses données, et d’une série d’exercices avec son corrigé.

Séance 1 : Introduction à R et RStudio

Date : 18 février 2026

Prise en main de R et de RStudio : types de données, vecteurs, data frames, importation de fichiers CSV et Excel, et premières fonctions.

I. Introduction à R et RStudio : notebook

Sources et données du notebook

Exercices 1

Exercices 1 : données et corrigé

Séance 2 : Le Tidyverse I

Date : 25 février 2026

Introduction au tidyverse : le pipe, la manipulation de tableaux avec dplyr et leur restructuration avec tidyr, appliquées à un jeu de données sociolinguistiques. Cette séance s’étend sur deux semaines.

II. Le Tidyverse I : notebook

Sources et données du notebook

Exercices 2

Exercices 2 : données et corrigé

Séance 3 : Le Tidyverse II et les statistiques uni- et bi-variées

Date : 11 mars 2026

Suite du tidyverse (jointures, regroupements, résumés), puis statistiques descriptives uni- et bi-variées sur un jeu de données de marqueurs pragmatiques.

III. Le Tidyverse II et les statistiques : notebook

Sources et données du notebook

Exercices 3

Exercices 3 : données et corrigé

Séance 4 : Les graphiques en R

Date : 18 mars 2026

La grammaire des graphiques avec ggplot2 : histogrammes, boîtes à moustaches, nuages de points, facettes et personnalisation, avec une ouverture sur les graphiques interactifs.

IV. Les graphiques en R : notebook

Sources et données du notebook

Exercices 4

Exercices 4 : données et corrigé

Séance 5 : Les tests statistiques

Date : 25 mars 2026

Rappel théorique sur les tests d’hypothèses, puis mise en pratique en R des tests classiques (moyennes, proportions, chi-carré, corrélation) sur des données phonétiques et sociolinguistiques.

V. Rappel sur les tests statistiques (slides)

V. Les tests statistiques : notebook

Sources et données du notebook

Exercices 5

Exercices 5 : données et corrigé

Séance 6 : Traitement des données textuelles

Date : 1er avril 2026

Constituer un corpus en R : lecture de fichiers texte, nettoyage, tokenisation, mots vides et premières statistiques lexicales avec quanteda, sur des articles de presse, des romans de Jules Verne et des programmes politiques.

VI. Traitement des données textuelles : notebook

Sources et données du notebook

Exercices 6

Exercices 6 : données et corrigé

Séance 7 : Annotations

Date : 15 avril 2026

Lemmatisation et annotation morphosyntaxique automatiques avec udpipe, lecture de corpus au format XML-TEI et passage des annotations vers quanteda. Le modèle de langue français s’obtient avec la commande udpipe_download_model() indiquée dans le notebook.

VII. Annotations : notebook

Sources et données du notebook

Exercices 7

Exercices 7 : données et corrigé

Séance 8 : Analyses de données textuelles

Date : 22 avril 2026

Analyses lexicométriques : fréquences et spécificités, cooccurrences, lisibilité et nuages de mots, sur les programmes des partis à l’élection présidentielle française de 2017.

VIII. Analyses de données textuelles : notebook

Sources et données du notebook

Exercices 8

Exercices 8 : données et corrigé

Séance 9 : Analyse factorielle des correspondances

Date : 29 avril 2026

Introduction théorique à l’AFC, puis son application à une table lexicale textes × mots avec FactoMineR, pour cartographier les programmes politiques et leur vocabulaire.

IX. Introduction à l’AFC (slides)

IX. Analyse factorielle des correspondances : notebook

Sources et données du notebook

Exercices 9

Exercices 9 : données et corrigé

Séance 10 : Régression linéaire

Date : 6 mai 2026

Introduction théorique à la régression, puis régression linéaire simple et multiple en R : variables indicatrices, sélection de modèle et interprétation des coefficients.

X. Introduction à la régression (slides)

X. Régression linéaire : notebook

Sources et données du notebook

Exercices 10

Exercices 10 : données et corrigé

Séance 11 : Analyse des correspondances multiples

Date : 13 mai 2026

L’ACM pour explorer un questionnaire à variables catégorielles : construction, interprétation des axes et des modalités, sur le jeu de données de marqueurs pragmatiques.

XI. Analyse des correspondances multiples : notebook

Sources et données du notebook

Exercices 11

Exercices 11 : données et corrigé

Séance 12 : Clustering

Date : 20 mai 2026

Classification hiérarchique et k-means sur des données phonétiques : choix du nombre de groupes, dendrogrammes et validation des partitions.

XII. Clustering : notebook

Sources et données du notebook

Exercices 12

Exercices 12 : données et corrigé

Séance 13 : Analyse de réseaux

Date : 27 mai 2026

Construire et analyser un réseau avec igraph et ggraph : mesures de centralité, détection de communautés et visualisation, à partir des données sociolinguistiques.

XIII. Analyse de réseaux : notebook

Sources et données du notebook

Exercices 13

Exercices 13 : données et corrigé