Cette page n’a pas pour vocation d’être exhaustive : je vais simplement lister les outils qui me concerne ou pourraient me concerner.

Collecte de données

Entretiens

Lorsque l’on interroge des enquêtés, dans une perspective éthique-données , il faut maîtriser la chaîne de traitement. Voici un article de blog qui pose plusieurs questions à ce sujet.

”Rendez-vous” de RENATER

Pour faciliter ce travail, RENATER propose une instance cryptée de bout-en-bout de Jitsi, sur son outil “Rendez-vous”. Celle-ci est accessible gratuitement avec un compte institutionnel universitaire.

La chaîne de traitement des données s’arrête à qui se connecte, avec quel type d’appareil. Et aucune donnée personne identifiante n’est conservée à la suite de la réunion. Les enregistrements sont locaux (sur la machine). Idéal pour des réunions jusqu’à 4 personnes.

Bigbluebutton

À privilégier pour des réunions de plus de 4 personnes.

Tixeo

Très performant, OK RGPD, mais n’est pas gratuit. Voici un article de blog qui traite de la sécurité des données.

Transformation des données

Transcription

NoScribe

TéléchargementDocumentationFormations
MacOS, Windows & Linux/Non-nécessaire, l’outil est facile à prendre en main.

Traduction de la présentation sur Github : Un logiciel basé sur l’IA qui retranscrit des entretiens pour une recherche sociale qualitative ou une utilisation journalistique noScribe est gratuit et open source (GPL-3.0) Il fonctionne entièrement en local sur votre ordinateur. Aucune donnée n’est envoyée sur Internet. Pas de cloud, pas de soucis Il peut distinguer différents locuteurs et comprend 99 langues (plus ou moins, voir ci-dessous) Il comprend un éditeur sympa pour réviser, vérifier et corriger la transcription résultante Il se tient sur les épaules de géants : Whisper d’OpenAI, faster-whisper de Guillaume Klein et pyannote d’Hervé Bredin.

Pourquoi utiliser noScribe ?

La plupart des doctorants recommandent d’utiliser la transcription de Microsoft office word. Cependant cette transcription envoie l’audio vers un serveur de Microsoft pour renvoyer sur l’ordinateur la transcription. Cette façon de faire ne permet pas de garantir la confidentialité des données de l’entretien. noScribe permet de garder la main sur les données, aucun serveur n’est sollicité, et il fonctionne très bien sans connexion. Attention en revanche, c’est gourmand en ressources ! De plus, contrairement à d’autres logiciels, noScribe permet une segmentation (ça facilite l’écoute-correction) et une identification des interlocuteur. L’export est en HTML, directement éditable dans l’interface.

Alternative si on ne possède pas d’ordinateur assez puissant : Les dossiers de transcription de Huma-num.fr, qui embarquent Whisper en tout confidentialité. Pensez simplement à citer Huma-num.fr comme tiers pour le traitement des données.

Sonal

TéléchargementDocumentationFormations
MacOS, Windows & LinuxOfficielleTuto MATE-SHS

Sonal est un logiciel gratuit d’analyse qualitative qui travaille directement sur le son : on surligne des segments de la bande audio, on les retranscrit et on les colore par thématique, sans repasser par un fichier texte intermédiaire. Le corpus compilé donne un “mur d’extraits” qui offre une vue d’ensemble transversale des thématiques codées.

Whispurge

Extension du même auteur (Alex Alber) pour “nettoyer” les transcriptions issues de Whisper : correction du texte, des tours de parole, ajout de marqueurs thématiques et de métadonnées, et anonymisation (fonctionnalité encore en développement).

Complémentarité avec noScribe

Whispurge se branche en aval d’une transcription Whisper (type noScribe) pour la préparer à l’analyse — pertinent pour ma chaîne de traitement éthique-données.

Pour l’anonymisation spécifiquement, voir plutôt Pseudonymizer Tool : contrairement à Whispurge (fonctionnalité encore en développement, outil externe), il tourne nativement dans Obsidian, en local, et gère déjà plusieurs formats de transcription (Jefferson, ICOR, SRT, CHAT/CHA).

Traitement de données

Datavisualisation

Palette couleur daltoniens ColorBrewer

Gephi

TéléchargementDocumentationFormations
MacOS, Windows & Linux/Régulières dans le réseau URFIST
Base tutorielle

Gephi est un logiciel de visualisation et d’analyse de données en réseau, développé par l’Institut des Systèmes Complexes de Paris (ISC-PIF). Il est conçu pour aider les chercheurs et les professionnels à comprendre et à analyser les structures et les dynamiques de réseaux complexes.

Plugins Gephi utiles :

Hyphe

Hyphe nous a été recommandé pour les mêmes applications, à des corpus plus grands. Ils ont une démo ouverte.

Iramuteq

TéléchargementDocumentationFormations
MacOS Big Sur & LinuxOfficielleRégulières dans le réseau URFIST

Iramuteq est un logiciel de traitement et d’analyse de données textuelles, développé par l’équipe de recherche en sciences sociales de l’Université de Paris. Il est conçu pour aider les chercheurs et les professionnels à analyser et à comprendre les données textuelles, notamment les textes écrits et les discours.

Recommandé par L. Alidières et F. Perea dans le cadre du Master Humanités numériques.

Gargantext

TéléchargementDocumentationFormations
En ligne (démo)Officielle/

Gargantext est un outil d’analyse et de cartographie de corpus textuels développé par l’ISC-PIF, orienté vers la construction de “phylomémies” (cartographie de l’évolution des termes/concepts dans le temps).

Usage envisagé

J’envisage une phylomémie collaborative de la psychiatrie grâce à Gargantext (cf. fragmentation-paradigmatique-psy) — encore en cours de prise en main, il y a “encore des bêtises là-dedans, mais ça avance doucement”.

MAXQDA

TéléchargementDocumentationFormations
MacOS, Windows (payant, licence univ. possible)OfficielleRégulières dans le réseau URFIST

MAXQDA est un logiciel CAQDAS (Computer-Assisted Qualitative Data Analysis) commercial, standard dans de nombreux laboratoires SHS : codage de corpus, requêtes croisées entre codes, mixed-methods (intégration de données quali/quanti).

Par rapport aux autres outils quali de cette fiche

Comparable à NVivo, moins cher. Pour ma part, je traite tout sur Obsidian.

Nettoyage de données

Pour la confidentialité, voir Pseudonymisation et anonymisation.

OpenRefine

OpenRefine est un outil de traitement et de nettoyage de données, conçu pour aider les utilisateurs à préparer et à transformer leurs données pour une analyse ou une visualisation ultérieure. Il est développé par l’équipe de Google et est maintenant maintenu par la communauté OpenRefine.

Pseudonymisation et anonymisation

La pseudonymisation (remplacement des identifiants par un code réversible) et l’anonymisation (irréversible) interviennent à plusieurs étapes de ma chaîne de traitement :

  • En amont, dans le nettoyage tabulaire, via OpenRefine (remplacement de valeurs identifiantes par lot).
  • En aval de la transcription textuelle, directement dans Obsidian, via Pseudonymizer Tool.
  • Pour les corpus vidéo/audio/photo, via EMCAnon.

Pseudonymizer Tool

TéléchargementDocumentationFormations
Community plugins ObsidianOfficielle/

Plugin Obsidian dédié à la pseudonymisation et à la correction de transcriptions d’interactions (formats Jefferson, ICOR, SRT, CHAT/CHA), pensé pour les chercheurs en linguistique et analyse conversationnelle. Il structure le corpus en dossiers (transcriptions / tables de correspondance / exports) et propose trois méthodes de repérage des entités à pseudonymiser : manuelle, reconnaissance d’entités nommées (NER, modèle exécuté en local via WASM) et scan par dictionnaire.

Pourquoi c'est intéressant pour moi

Tout le traitement reste local — aucun texte de transcription n’est envoyé à un serveur externe (seule exception documentée : la fonction “Pseudonymize with Coulmont”, qui envoie le seul prénom source, pas le contenu, à coulmont.com/bac pour proposer un prénom équivalent). Ça s’intègre directement dans le vault, sans sortir de mon environnement de travail — contrairement à Whispurge qui reste un outil externe à Sonal. Et puis… J’ai développé l’outil pour qu’il soit compatible avec plusieurs formats de transcription, ainsi il reste compatible pour de l’analyse conversationnelle (et ça manque beaucoup). J’ai fait un cours sur cet outil et un autre.

À trancher

Choisir un protocole homogène (codes attribués aux enquêtés, table de correspondance stockée séparément du corpus…) plutôt que de gérer ça au cas par cas outil par outil.

EMCAnon

EMCAnon est un outil d’anonymisation de corpus multimodaux (vidéo, audio, photo) que j’ai développé pour les besoins de l’analyse conversationnelle et ethnométhodologique (EMCA). Il supprime les données visuelles et vocales identifiantes tout en conservant les données analytiques : le squelette du mouvement (MediaPipe Holistic pour une personne, ou DWPose en multi-personnes) et la prosodie — rythme, pauses, intonation (vocodeur WORLD pour un rendu plus propre, ou coefficient de McAdams, plus robuste sur de l’audio de mauvaise qualité). Il permet aussi l’extraction de frames à des timecodes précis et le masquage audio (bips ou bruit) de segments sensibles. Traitement 100% local/hors-ligne — via interface web (GUI) ou scripts Python en ligne de commande pour du traitement par lot.

Pourquoi je l'ai développé

Détaillé dans mon cours Privacy Ecosystem : la tension de départ, c’est protéger l’identité des enquêtés sans sacrifier la richesse analytique du matériau — un enjeu d’autant plus sensible sur mon terrain (matériau psychiatrique, mineurs impliqués).

J’y présente la chaîne intégrée que j’ai construite pour ça : noScribe → Obsidian + Pseudonymizer Tool → ELAN pour le texte, et EMCAnon pour l’audiovisuel — avec un principe directeur unique, un traitement 100% local, de bout en bout. Quelques scripts existants couvraient la partie vidéo/audio en préservant gestualité et prosodie (vous trouverez les références sur le gitlab), mais aucun ne le faisait avec une interface qui puisse démocratiser la pratique, en tant qu’ancienne webmarketer et ux designer, c’est là que je pouvais jouer ma carte.

Citation

Abbadie, A. (2026). EMCAnon [Logiciel]. UR LHUMAIN, Université de Montpellier Paul-Valéry.

Data Research Management

Heurist

TéléchargementDocumentationFormations
En ligne (hébergé Huma-Num)OfficielleAteliers réguliers Huma-Num / MESHS

Heurist est un système de base de données générique pour les sciences humaines et sociales (Université de Sydney, hébergé en France par Huma-Num). Il permet de construire une BDD relationnelle riche (textes, images, données spatiales, réseaux de relations) via une interface web, sans compétence en programmation ni administration serveur.

Pourquoi ça pourrait m'intéresser

Contrairement à un simple export CSV, Heurist permet de typer et relier finement les entités de mon corpus (entretiens, institutions, acteurs…) et de les interroger ensuite — potentiellement via SPARQL ou son interface de requête intégrée.

SPARQL

TéléchargementDocumentationFormations
/ (langage, pas un logiciel)Spec W3C — Tutoriel Wikidata/

SPARQL est un langage de requête pour interroger des données structurées en graphe (RDF), comme Wikidata ou les BDD sémantiques utilisées en humanités numériques. Utile pour extraire des sous-ensembles précis d’une base de connaissances sans passer par une interface graphique.

QUARTO

TéléchargementDocumentationFormations
MacOS, Windows & LinuxOfficielle - Base templates univ
Régulières dans le réseau URFIST

QUARTO est un outil de gestion de données et de métadonnées conçu pour les chercheurs et les institutions de recherche. Il permet de gérer et de partager des données de recherche de manière efficace et efficiente, tout en garantissant leur qualité et leur sécurité.

Tropy

Gestionnaire de corpus d’images.

TéléchargementDocumentationFormations
MacOS, Windows & LinuxOfficielle
Blog
Un outil de gestion d’images conçu spécifiquement pour les chercheurs et les historiens. Il permet de cataloguer, d’organiser et d’analyser des collections d’images, notamment des photographies et des diapositives.

Tropy offre plusieurs fonctionnalités intéressantes, telles que :

  • La création de métadonnées pour les images, comme des descriptions, des dates et des lieux
  • La possibilité de créer des collections et des dossiers pour organiser les images
  • Des outils d’analyse et de recherche pour trouver des images spécifiques
  • La possibilité d’exporter les métadonnées et les images vers d’autres outils, comme Obsidian, Omeka, etc

Recherche documentaire

Click & Read

TéléchargementDocumentationFormations
Firefox, Chrome, Edge, SafariOfficielle/

Extension de navigateur développée par l’Inist-CNRS qui détecte automatiquement les identifiants de documents (DOI, PMID, ISBN) sur une page web (Google Scholar, Wikipedia…) et signale si le texte intégral est accessible via Unpaywall, Istex, Panist ou l’abonnement de mon institution. Pas d’interface de recherche dédiée : ça fonctionne en tâche de fond pendant la veille documentaire.

Valorisation et diffusion

Reveal.js

TéléchargementDocumentationFormations
GitHub / npmOfficielle/

Framework HTML/JS pour créer des présentations interactives (diapositives dans le navigateur, animations, export PDF). Alternative à PowerPoint/Keynote pour des présentations versionnables en texte (Markdown → diapo) — intéressant si je veux garder mes supports de colloque dans le même flux que mes notes.

OpenAIRE

TéléchargementDocumentationFormations
Plateforme en ligneGuide de dépôt/

Infrastructure européenne d’agrégation de la littérature scientifique et des données de recherche en open access. Ne pas confondre avec un entrepôt : OpenAIRE référence les métadonnées de multiples entrepôts (dont Zenodo, hébergé par le CERN) plutôt que d’héberger lui-même les données. Utile pour le dépôt final de mon corpus/mes données de thèse en accès ouvert, en complément de HAL.