Étude du vocabulaire traitant d'un fait d'actualité internationale : cas du dossier nucléaire iranien dans la presse écrite québécoise et française
Notice bibliographique
Résumé
Dans le cadre de ce mémoire, nous nous sommes intéressée au vocabulaire utilisé par la presse francophone, à savoir française et québécoise, lorsqu'elle traite d'un fait d'actualité internationale. L'objectif de la présente étude exploratoire est de vérifier si l'information diffusée par la presse écrite quotidienne au Québec, concernant le dossier nucléaire iranien, est différente de celle diffusée par la presse écrite quotidienne française. Cette vérification a été faite à partir d'un corpus de textes publiés par deux quotidiens québécois, La Presse et Le Devoir, et deux quotidiens français, Le Monde et Le Figaro. Le but de notre recherche était de procéder à l'analyse du vocabulaire employé par ces quatre quotidiens lorsqu'ils diffusent l'information touchant le dossier nucléaire iranien. Nous nous sommes intéressée à la sélection et à la distribution des mots-clés composant le discours de ces quotidiens diffusés au Québec et en France. Nous avions posé l'hypothèse suivante : l'information internationale diffusée au public québécois est différente de celle diffusée en France, et cette différence est perceptible par le vocabulaire employé. Pour considérer cette question de recherche, nous avons constitué un corpus composé de tous les articles publiés par deux quotidiens français, Le Figaro et Le Monde, et par deux quotidiens québécois, La Presse et Le Devoir traitant du dossier nucléaire iranien, entre le 14 et le 31 janvier 2006. Ces articles ont été soumis à une analyse statistique textuelle effectuée à l'aide du logiciel Alceste. Le vocabulaire employé pour la diffusion des informations touchant le dossier nucléaire iranien s'est avéré différent dans les quotidiens français et québécois. Ces différences sont effectivement perceptibles par le degré d'importance donnée aux mots constituant ce vocabulaire et par leur distribution dans les textes de chaque quotidien étudié. Notre étude se distingue des démarches d'analyse dans lesquelles la subjectivité du chercheur n'est pas suffisamment contrôlée aux endroits névralgiques du processus de recherche. Grâce à l'analyse statistique des données textuelles appliquée à notre corpus, nous sommes en mesure d'appuyer notre interprétation des textes sur des données factuelles. L'étude de la distribution des formes (mots) dans les textes nous a permis de retracer puis de décrire les différentes tendances inscrites dans un corpus traitant d'un même fait d'actualité. En d'autres termes, cette étude de la distribution des formes nous a permis de mettre en évidence des sous thèmes, des dimensions, des pôles du discours, des tendances préférentielles dans le traitement de la même information. Ainsi, Le Figaro s'est intéressé davantage au volet économique et militaire du dossier iranien; La Presse, à la proposition russe d'enrichir l'uranium iranien sur son propre sol et à l'aspect technique et scientifique de la technologie nucléaire; Le Devoir, aux efforts diplomatiques et à la technologie nucléaire, et enfin, Le Monde, qui s'est particulièrement intéressé au discours de Chirac et à l'inflexion de la doctrine de dissuasion française, a pu rendre compte de toutes les facettes du sujet. Notre hypothèse se confirme donc : l'information, concernant le dossier nucléaire iranien, diffusée au public québécois est différente de celle diffusée en France, et cette différence est perceptible par le vocabulaire employé.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Étiquettes directes de modèles (non validées)
Étiquettes de catégorie et de devis d'étude par modèle, issues des rondes d'étiquetage. C'est une sortie machine, non validée, et le désaccord entre modèles est livré comme donnée. Aucun devis ici n'est encore validé contre MEDLINE.
| Bras | Catégories | Devis d'étude | Confiance |
|---|---|---|---|
| gemma | aucune catégorie Domaine: non disponible · Genre: Empirique Porte sur le système de recherche canadien: non · Porte sur un sujet canadien: oui | Observationnel | low |
| gpt | aucune catégorie Domaine: non disponible · Genre: Empirique Porte sur le système de recherche canadien: non · Porte sur un sujet canadien: non | Qualitatif | high |
Prédiction distillée sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Apprise à partir de 10 348 étiquettes directes de Codex et de 10 348 étiquettes directes de Gemma. Le mode candidate est l'union des têtes enseignantes seuillées; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont ni des étiquettes humaines ni des étiquettes directes de modèles de pointe.
Scores Codex et Gemma par catégorie
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,001 | 0,000 |
| Méta-épidémiologie (sens strict) | 0,001 | 0,000 |
| Méta-épidémiologie (sens large) | 0,001 | 0,001 |
| Bibliométrie | 0,000 | 0,001 |
| Études des sciences et des technologies | 0,001 | 0,003 |
| Communication savante | 0,000 | 0,000 |
| Science ouverte | 0,002 | 0,000 |
| Intégrité de la recherche | 0,001 | 0,000 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,002 | 0,000 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéeÉtiqueté directement par 2 modèles lisant le dossier complet.
Les modèles divergent sur des parties de cette classification; chaque voix est préservée dans la section en fin de page.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».