Renforcement des Systèmes de Détection d’Intrusions : approche basée sur les techniques Avancées d'Apprentissage Automatique
Bibliographic record
Abstract
Service de la bibliothèque Avertissement L'auteur de ce mémoire, de cette thèse ou de cet essai a autorisé l'Université du Québec à Trois-Rivières à diffuser, à des fins non lucratives, une copie de son mémoire, de sa thèse ou de son essai.Cette diffusion n'entraîne pas une renonciation de la part de l'auteur à ses droits de propriété intellectuelle, incluant le droit d'auteur, sur ce mémoire, cette thèse ou cet essai.Notamment, la reproduction ou la publication de la totalité ou d'une partie importante de ce mémoire, de cette thèse et de son essai requiert son autorisation. Résumé Les systèmes de détection d'intrusion (Intrusion Detection System IDS) sont des éléments vitauxdes cadres d'applications de cybersécurité actuelle dans le monde, conçues pour contrôler les trafics réseau pour détecter les activités malfaisantes.Grâce à l'apprentissage automatique, les IDS ont la capacité d'analyser un énorme volume de données pour identifier les anomalies et les menaces.Cependant, ces systèmes souffrent de certaines lacunes, notamment la fragilité aux attaques contradictoires et les distributions déséquilibrées des données.Les attaques contradictoires ajoutent des perturbations subtiles qui induisent les modèles en erreur, réduisant de ce fait leur efficacité à détecter précisément ces intrusions.En outre, les données déséquilibrées, qui sont typiques dans les problèmes de détection d'intrusion, limitent la capacité des modèles à identifier les menaces rares, mais critiques.Dans ce projet, nous avons travaillé à l'aide du jeu de données CIC IDS 2018, un jeu de données complet et connu de la communauté de référence pour évaluer la performance des IDS.Nous avons abordé ces défis en utilisant une méthodologie sophistiquée combinant des techniques d'apprentissage automatique modernes.Après avoir prétraité et équilibré les données à l'aide de la méthodologie SMOTE, nous avons testé plusieurs algorithmes, y compris la forêt aléatoire, arbre de décision, les réseaux convolutifs, les réseaux à mémoire à long terme, et des réseaux siamois combinant CNN et LSTM.Pour augmenter la robustesse des modèles, nous avons utilisé la méthode FGSM pour dériver les exemples contradictoires utilisés pour entraîner et tester les modèles pour leur résilience face à ces adversités.Nous avons observé que, bien que les exemples classiques, notamment forêt aléatoire et arbre de décision, soient généralement stables, les modèles avancés, en particulier les réseaux siamois combinant CNN et LSTM, affichent des performances de plus de 98.9 %, ce qui indique l'efficience des combinaisons dans l'apprentissage de modèles complexes sans compromettre leur robustesse face à des adversités.
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.006 | 0.017 |
| Meta-epidemiology (narrow) | 0.002 | 0.001 |
| Meta-epidemiology (broad) | 0.002 | 0.001 |
| Bibliometrics | 0.002 | 0.001 |
| Science and technology studies | 0.001 | 0.002 |
| Scholarly communication | 0.003 | 0.003 |
| Open science | 0.003 | 0.002 |
| Research integrity | 0.002 | 0.003 |
| Insufficient payload (model declined to judge) | 0.004 | 0.002 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".