MétaCan
Menu
Retour à la cohorte
Enregistrement W7077171100

GenQA : Génération et validation d'un ensemble de couples de Questions/Réponses générés à partir de données journalistiques

2024· other· fr· W7077171100 sur OpenAlexaboutno aff

Notice bibliographique

RevuePolyPublie (École Polytechnique de Montréal) · 2024
Typeother
Languefr
DomainePhysics and Astronomy
ThématiqueTheoretical and Computational Physics
Établissements canadiensnon disponible
Organismes subventionnairesnon disponible
Mots-clésContext (archaeology)Knowledge productionWord-sense disambiguation
DOInon disponible

Résumé

récupéré en direct d'OpenAlex

RÉSUMÉ: De nos jours, les visualisations de données sont de plus en plus utilisées dans les articles de presse en ligne, notamment au sein de data-driven storie. Néanmoins, du fait de leur nature visuelle, ce type de contenu n’est que très peu accessible aux utilisateurs atteints de déficience visuelle. Ces utilisateurs doivent ainsi utiliser différents intermédiaires pour rendre audibles ces visualisations de données et accéder à l’information. C’est ainsi qu’un agent conversationnel ou un lecteur d’écran peut être utilisé. La rédaction de texte alternatif est actuellement le standard d’accessibilité le plus communément utilisé pour fournir une description textuelle d’une image. Ces descriptions générales restent néanmoins peu utilisées par les salles des nouvelles de manière générale, et plus spécifiquement, pour les visualisations de données. De plus, lorsqu’elles sont existantes, elles sont généralement jugées trop simplistes par les utilisateurs atteints de déficience visuelle car lacunaires. Plusieurs facteurs, humains comme économiques, peuvent être à l’origine de cette situation. Le nombre limité de journalistes disponibles pour rédiger ces descriptions détaillées, le manque de règles de rédaction précises et standardisées ainsi que la potentielle courbe d’apprentissage de la salle des nouvelles sont autant de limites liées à ce contexte journalistique. Pour accroître cette accessibilité, nous proposons une nouvelle approche afin d’assister les journalistes dans leur production de description de visualisation de données, basée sur un ensemble de paires de Question/Réponse (Q/A) générés par IA. Du fait des limites journalistiques précédemment listées, notre méthodologie génère ces Q/As en utilisant un modèle de Traitement Automatique en Langage Naturel (TALN) basé sur une IA générative. Cette approche atténue la charge de travail de la rédaction des Q/As en l’homogénéisant, permettant ainsi une exploration plus systématique et exhaustive des paires possibles pour une visualisation de données spécifique. Néanmoins, l’utilisation d’outils à base d’IA générative dans un contexte journalistique représente un risque quant à la publication d’informations peu fiables voire biaisées. Cet écueil est contrebalancé par le grand degré de contrôle accordé au journaliste sur l’ensemble Q/As généré. Pour permettre et optimiser cette tâche de validation obligatoire, nous avons conçu une interface où les paires de Q/As sont regroupées autant sémantiquement que lexicalement mais aussi en terme d’intérêt lié à l’accessibilité. Des aides à la décision visuelles sont également utilisées afin d’améliorer la prise de décision du journaliste. Pour évaluer cette méthodologie, baptisée GenQA, une étude comparative réunissant des journalistes de différents médias québécois a été menée. Cette étude a mis en avant la capacité de l’interface à assister les journalistes dans la production de description détaillée de visualisation de données. Ce constat repose notamment sur la sérendipité de GenQA, permettant de couvrir des thématiques non anticipées par les journalistes. De ces observations ont également émergé deux profils de journalistes distincts, fonction du nombre des couples de Q/A sélectionnés. Le premier, validant un nombre restreint de couples, consiste à choisir quelques couples sans en considérer l’intégralité. À l’opposé, le second profil propose une vérification systématique des Q/As, conduisant ainsi un temps de validation plus conséquent. ABSTRACT: Data visualizations are now commonly used in online press articles and so-called data-driven stories. However, due to its visual nature, this type of content inherently lacks accessibility (e.g. when one wants to consume those visualizations using conversational agents, hearing them in audible formats, or using screen readers). Writing alternative texts is the recommended standard in order to provide text descriptions associated to an image. However, newsrooms rarely produce them for data visualizations, or when they do, these are overly simplistic. Several intertwined limitations explain that situation: the limited amount of time journalists have to produce these expected detailed descriptions, a lack of precise and standardized writing guidelines for describing visualizations, and a potential learning curve in the newsroom. To improve this situation, we propose a new approach to help journalists produce a visualization description, based on a set of generated question and answer pairs (hereafter called Q/A). Due to the previously enumerated limitations, our method first generates those Q/As using a generative NLP AI model. This approach alleviates and homogenizes the writing task workload and allows for a systematic and more exhaustive exploration of the possible Q/As for a given visualization. However, among the critical challenges of using AI-based generative tools in a journalism context is the risk of publishing unreliable or biased information. Therefore, the methodology proposed in this paper gives the journalist user a high level of control over the AI-generated Q/As. To enable and optimize this mandatory validation task, we design an interface where Q/As are grouped in terms of semantic and textual content, and accessibility interest. Visual cues are also displayed to improve the journalist’s decision-making. To evaluate this proposed methodology, that we call GenQA, we conducted a comparative design study that gathered journalists from two different Canadian newsrooms. We observed that GenQA was efficiently used by those users and helped them to produce detailed visualization descriptions that met their expectations in terms of quality and workload. This study also showed that GenQA triggered significant serendipity potential, allowing users to explore and produce Q/As that cover aspects they might not have considered. Additionally, from these observations, two distinct profiles of journalists have also emerged, depending on the number of Q/A pairs selected. The first profile, validating a limited number of pairs, involves choosing a few pairs without considering the entirety. In contrast, the second profile suggests a systematic verification of Q/As, resulting in a more substantial validation time.

Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.

Comment cette classification a été obtenuedéplier

Prédiction distillée sur la base complète

Imitation des enseignants

Ni prévalence calibrée, ni vérité terrain. Validation humaine à venir. Apprise à partir de 10 348 étiquettes directes de Codex et de 10 348 étiquettes directes de Gemma. Le mode candidate est l'union des têtes enseignantes seuillées; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont ni des étiquettes humaines ni des étiquettes directes de modèles de pointe.

score de la tête « metaresearch » (Codex)0,001
score de la tête « metaresearch » (Gemma)0,000
Version: codex-gemma-dda1882f352aStatut de validation: machine_predicted_unvalidated
Catégories candidatesMéta-épidémiologie (sens strict), Communication savante
Catégories consensuellesaucune
DomaineSignal candidat: aucune · Signal consensuel: aucune
Devis d'étudeSignal candidat: Théorique ou conceptuel · Signal consensuel: Théorique ou conceptuel
GenreSignal candidat: Empirique · Signal consensuel: aucune
Score de désaccord entre enseignants0,832
Score d'incertitude au seuil1,000

Scores Codex et Gemma par catégorie

CatégorieCodexGemma
Métarecherche0,0010,000
Méta-épidémiologie (sens strict)0,0010,001
Méta-épidémiologie (sens large)0,0010,000
Bibliométrie0,0000,000
Études des sciences et des technologies0,0000,000
Communication savante0,0010,000
Science ouverte0,0010,000
Intégrité de la recherche0,0010,001
Charge utile insuffisante (le modèle a refusé de juger)0,0010,000

Scores machine (provisoires)

Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.

Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.

Tête enseignante Opus0,011
Tête enseignante GPT0,249
Écart entre enseignants0,238 · la distance entre les deux têtes enseignantes sur ce seul travail
Statut de validationscore_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découle

Classification

machine, non validée

Prédiction automatique; un appel candidat d’une seule tête enseignante, pas un consensus.

Devis d'étudeThéorique ou conceptuel
Domainenon disponible
GenreEmpirique

Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».

En bref

Citations0
Publié2024
Routes d'admission1
Résumé présentoui

Explorer davantage

Même revuePolyPublie (École Polytechnique de Montréal)Même sujetTheoretical and Computational PhysicsTravaux en français237 207