Réalisations des stagiaires

Dans le cadre de notre stage IA et analyse des données du Web archivé : entre sciences de l’informatique et histoire numérique en collaboration avec le LIS, nos brillants stagiaires Dang, Sasha et Allan ont eu l’occasion d’entreprendre de brillantes réalisations. Les voici !

Dang Nguyen

WARChat : une interface d’exploration augmentée pour les archives web de Marsactu

Dans le cadre de mon stage au LIS en collaboration avec TELEMMe, j’ai travaillé sur la valorisation de corpus d’archives web destinés à des usages de recherche en sciences humaines et sociales. Les données étudiées, fournies par la BnF et l’INA, concernent notamment les archives du Marsactu et du francetvinfo.fr. Disponibles sous différents formats (WARC, CSV, NDJSON) et représentant des volumes importants, ces données nécessitent plusieurs étapes de préparation avant de pouvoir être exploitées.

Une première partie du travail a consisté à développer des scripts de nettoyage et de transformation afin de construire des corpus exploitables. Les lots fournis par la BnF contenaient de nombreuses ressources non pertinentes pour l’analyse scientifique (pages techniques, pages de navigation, doublons, fichiers statiques, pages fonctionnelles, etc.). Des traitements adaptés aux différents formats ont donc été mis en place : extraction et filtrage du contenu éditorial depuis les fichiers WARC du corpus Marsactu J1, nettoyage et normalisation des listes d’URLs issues des lots CSV J2 et J3, ainsi qu’une réduction du bruit avant les étapes d’indexation. En parallèle, un script de conversion NDJSON vers WARC a été développé afin d’expérimenter l’utilisation d’un échantillon du corpus INA avec l’outil SolrWayback.

À partir du corpus Marsactu nettoyé (3 979 articles indexés couvrant la période 2011–2015), j’ai développé WARChat, une interface permettant d’explorer les archives web selon plusieurs approches complémentaires. L’outil propose une recherche plein texte basée sur SQLite FTS5 et le classement BM25, un assistant conversationnel reposant sur une approche RAG (Retrieval-Augmented Generation) combinant recherche documentaire et modèle de langage local exécuté via Ollama, ainsi qu’un module d’analyse statistique permettant d’explorer l’évolution du corpus, les auteurs principaux et la présence d’entités au fil du temps.

Ce projet montre comment des archives web complexes peuvent être transformées en ressources accessibles aux chercheurs grâce à une combinaison entre préparation des données, recherche documentaire et intelligence artificielle. Les perspectives d’évolution concernent notamment l’amélioration de la recherche hybride combinant approches lexicales et sémantiques, ainsi que le renforcement de la traçabilité des réponses générées par l’ajout de mécanismes de citation des sources.

Code source : https://gitlab.huma-num.fr/weblab/iawarc.git

Sasha Sutton

Analyser un corpus de presse locale à partir d’une
archive web

Ce que j’ai fait :
Pendant ce stage, j’ai travaillé sur une archive web du journal marseillais Marsactu, que la BnF nous a fournie au format WARC (un gros fichier de 419 Mo).
Mon but était de partir de ce fichier brut et d’arriver à une analyse des thèmes abordés par le journal entre 2011 et 2015.
J’ai commencé par explorer l’archive pour comprendre ce qu’elle contenait vraiment. C’est là que j’ai vu que la BnF avait tout aspiré en une seule fois début 2012, ce qui rendait la date de capture inutilisable pour suivre l’évolution dans le
temps. J’ai donc dû aller chercher la vraie date de publication directement dans le code des pages. Ça m’a permis de faire une petite analyse diachronique, année par année, même si elle reste limitée : une bonne partie des anciens articles n’avaient pas de texte exploitable, seulement de la navigation WordPress.

Ensuite j’ai construit le corpus proprement (2 656 articles), nettoyé les textes, puis testé deux façons de repérer les grands thèmes : la LDA, une méthode classique, et BERTopic, plus récente. Les deux donnent des résultats intéressants à comparer. La LDA sort 5 thèmes assez larges, BERTopic en trouve 14, beaucoup plus précis (la crise de la SNCM, la French Tech, l’affaire Kem One, la pêche en Méditerranée). J’ai aussi repéré les personnes les plus citées, et sans
surprise ce sont surtout des politiques : Gaudin, Mennucci, Guérini.

Tout le travail est organisé en quatre notebooks Python qu’on peut relire dans l’ordre, avec les données et les figures.

Quelques résultats :
Le code
Tout le projet est disponible sur le dépôt.

Allan Diny

Nettoyage de fichiers et extraction d’informations

Dans le cadre de mon stage, j’ai réalisé trois livrables :

  • Deux notebooks permettant de nettoyer un fichier CSV contenant les permaliens du site Marsactu.
  • Une application web locale permettant de nettoyer les pages HTML de fichiers WARC afin d’en extraire les entités nommées et les thématiques. Les informations obtenues sont exploitables de trois façons :
    • une visualisation directe de la page archivée ;
    • un tableau de bord interactif, filtrable par année et par fichier ;
    • un assistant conversationnel basé sur une architecture Retrieval-Augmented Generation (RAG) fonctionnant en local.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *