Bibliographic record
Abstract
Je tiens tout d'abord à remercier mon directeur de recherche, Michel Dagenais, pour la confiance qu'il m'a accordée dès notre première rencontre et qu'il a renouvelée sans cesse depuis lors.Son soutien et sa disponibilité m'ont permis d'en apprendre toujours plus tout en ayant à ma disposition tous les outils me permettant d'avancer.Je souhaite ensuite remercier les partenaires du laboratoire pour leur soutien financier grâce auquel j'ai pu mener à bien mes travaux.Je remercie également toutes les personnes impliquées dans le projet qui m'ont transmis une partie de leurs connaissances, qui j'en suis sûr m'aideront pour la suite.Un merci tout particulier à Alex, Matthew, Etienne, Francis, Yannick et bien sûr Geneviève pour leur aide précieuse.Merci encore à tous mes collègues du laboratoire DORSAL pour la très bonne ambiance de travail.J'aimerais remercier mes proches et amis qui ont toujours été là pour moi et m'ont encouragé à me dépasser.Je remercie tout particulièrement mon père, Pascal, pour m'avoir laissé partir sur un autre continent, ainsi que Céline Roehrig et son compagnon Jessy pour m'avoir accueilli à mon arrivée au Canada et m'avoir donné le soutien logistique indispensable à mon installation sur un continent nouveau pour moi.Enfin, merci à Karine Marle, ma compagne, qui a fait son maximum pour venir me rejoindre au Canada.Un grand merci pour son soutien, ses conseils et sa relecture attentive ainsi que pour tous les bons moments passés ensemble à la découverte du "nouveau monde".v R ÉSUM É Avec la complexité croissante des systèmes informatiques, l'analyse des problèmes de performance devient de plus en plus difficile.L'utilisation des outils de traçage s'est imposée comme la méthode permettant de comprendre en profondeur le fonctionnement d'un logiciel ou d'un système d'exploitation.Le traceur LTTng (Linux Tracing Toolkit Next Generation) et le visualiseur de traces TMF (Tracing and Monitoring Framework) ont été développés au laboratoire DORSAL de l' École Polytechnique de Montréal.Ce traceur permet de recueillir des traces au niveau du noyau et au niveau des applications utilisateur.La quantité d'informations sauvegardées dans les traces systèmes est très importante pouvant dépasser les centaines de gigaoctets.L'enjeu principal des techniques d'analyse est d'extraire les informations utiles au développeur pour comprendre son application et l'aider à trouver les anomalies de performance ou de sécurité.La méthode retenue par le visualiseur de trace TMF pour extraire les données d'une trace est basée sur une machine à états qui permet de modéliser l'état du système à n'importe quel point de la trace.Dans le cas des traces noyaux produites par LTTng, cette méthode permet d'afficher de manière très efficace l'état des fils d'exécution et la consommation de ressources dans des diagrammes en fonction du temps.Dans ce mémoire, nous proposons de généraliser l'utilisation du gestionnaire d'états de TMF à tous les types de traces, en proposant un outil pour concevoir de manière flexible des nouvelles analyses utilisant une machine à états.Pour ce faire nous avons créé un langage déclaratif permettant d'utiliser le gestionnaire d'états déjà implémenté dans TMF.La méthodologie suivie dans ce mémoire va permettre de définir un langage dont l'expressivité permettra de caractériser les changements d'états provoqués par les événements de la trace.Dans un contexte où l'extraction des informations issues d'une trace peut être longue, nous veillons à ce que la performance des nouveaux outils développés soit au moins équivalente à celle des outils actuels.Les résultats obtenus avec l'implémentation de la solution montrent qu'il n'y a pas de dégradation de la performance pour le temps de construction de la machine à états.Enfin, nous essayons de démontrer l'utilisabilité de la solution en proposant des exemples de nouvelles analyses rendues possibles avec le nouveau langage déclaratif.Ce point passe par l'illustration d'un exemple simple permettant de comprendre la philosophie du nouvel outil.Nous démontrons ensuite la capacité du langage d'abstraire le modèle utilisé, permettant vi d'effectuer les mêmes analyses avec des systèmes de traçage différents.Cette étude a permis de transposer le modèle existant du noyau Linux au noyau du système d'exploitation Microsoft Windows.De même, il a été possible d'enrichir les modèles existants en combinant plusieurs traces issues de différents niveaux d'abstraction, par exemple espace noyau et espace utilisateur.Cela a permis de construire des analyses plus riches, ouvrant la possibilité de corriger des nouvelles classes d'anomalies dans les systèmes étudiés.Ainsi, le résultat de l'étude montre qu'un langage déclaratif peut être utilisé pour concevoir des analyses flexibles, ne nécessitant aucun développement supplémentaire pour l'utilisateur.vii
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.014 | 0.033 |
| Meta-epidemiology (narrow) | 0.002 | 0.002 |
| Meta-epidemiology (broad) | 0.001 | 0.005 |
| Bibliometrics | 0.008 | 0.004 |
| Science and technology studies | 0.004 | 0.005 |
| Scholarly communication | 0.020 | 0.015 |
| Open science | 0.004 | 0.007 |
| Research integrity | 0.004 | 0.005 |
| Insufficient payload (model declined to judge) | 0.011 | 0.003 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".