Modèle hiérarchisé des dix principes majeurs d'élaboration de données de grammaire d'approche raisonnée
Notice bibliographique
Résumé
Le texte de ce mémoire pose le problème des stratégies à retenir pour favoriser l'élaboration de données de grammaire de qualité, de telles données étant définies dans ce mémoire comme d'approche raisonnée et pouvant s'intégrer aux contenus du courant de grammaire dite logique et raisonnée. Des données d'une telle nature devraient pouvoir être adoptées - ce semble aller de soi - par tout courant de grammaire tourné vers la compréhension et l'explication fine. \n \nLouise Lefebvre (2000) et Guillaume Couture (2000) ont identifié à titre de stratégies, la première, sept principes, le second, un huitième principe, susceptibles de guider efficacement le travail d'élaboration de données grammaticales d'approche raisonnée. Ce travail de recherche veut profiter de l'élaboration d'un matériel didactique sur la conjugaison du verbe français, produit par le professeur Raymond Claude Roy et l'Équipe FRAMÉE de recherche en grammaire et didactique du français, pour réexaminer les principes proposés par Lefebvre et Couture afin de les nuancer ou même de les écarter, pour également voir s'il n'y a pas lieu d'identifier quelqu'autre principe à avancer. La réflexion porte aussi sur une hiérarchisation des principes retenus. \n \nLe résultat obtenu est celui de reconnaître que l'effort d'élaboration de données grammaticales d'approche raisonnée doit prendre son départ dans un examen critique des données de la grammaire traditionnelle (premier principe), lesquelles ne sont pas à écarter de façon désinvolte. Il est celui de poser ensuite que l'effort d'élaboration gagne à puiser aux analyses de la linguistique structurale, particulièrement psychomécanique (deuxième principe), et aux analyses de linguistique menées dans la même veine (troisième principe). \n \nLa réflexion poursuivie dans le mémoire identifie ensuite quelques balises à respecter : c'est ainsi que les efforts d'élaboration doivent s'attacher à traiter de tous les cas d'emploi (quatrième principe), s'attacher à reconnaître la place prépondérante de l'oral (cinquième principe), et s'attacher à produire des données de nature majoritairement synchronique (sixième principe). \n \nEnfin, les données grammaticales produites doivent se présenter simples, claires et nettes (septième principe) et devront pouvoir rendre compte de la vie de la langue (huitième principe). Les données produites gagneront également à s'enrichir de procédés didactiques les épousant (neuvième principe). Un dixième et dernier principe propose de ne pas fuir les données échappant à l'explication, de plutôt leur faire une place de choix à titre d'hypothèses. Il est encore posé que d'autres principes pourront être avancés éventuellement à la lumière d'analyses méthodologiques plus poussées. \n \nL'analyse de méthodologie - menée aussi rigoureusement que possible dans ce travail de recherche - fournit donc à ceux et celles qui choisissent de s'attaquer à l'élaboration de données grammaticales d'approche raisonnée dix principes susceptibles de les mener au succès. A supposer, dernière réflexion, que des intuitions opportunes viennent alimenter la démarche mductive d'élaboration.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,006 | 0,013 |
| Méta-épidémiologie (sens strict) | 0,001 | 0,001 |
| Méta-épidémiologie (sens large) | 0,001 | 0,001 |
| Bibliométrie | 0,002 | 0,002 |
| Études des sciences et des technologies | 0,003 | 0,008 |
| Communication savante | 0,009 | 0,010 |
| Science ouverte | 0,002 | 0,005 |
| Intégrité de la recherche | 0,002 | 0,006 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,023 | 0,008 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».