Implementación de un servicio de detección de ataques de denegación de sistemas
Notice bibliographique
Résumé
Los ataques DDoS (Denial of Service) han sido una amenaza persistente en el ciberespacio desde la década de 1990, y su sofisticación y frecuencia han ido en aumento. Estos ataques implican la saturación maliciosa de recursos de red o sistemas informáticos, lo que resulta en la interrupción del servicio para usuarios legítimos. Esta actividad no solo representa un problema económico para las empresas, sino que, cuando los objetivos son infraestructuras críticas como las de comunicaciones o sanitarias, estos ataques pueden utilizarse como métodos de desestabilización. \n \nEn la actualidad, discernir si una conexión es legítima o no es complicado. Los sistemas pueden enfrentar dificultades para manejar el volumen del tráfico generado en estos ataques y tienden a generar falsos positivos, bloqueando así conexiones legítimas. El objetivo de este trabajo es recopilar datos, limpiarlos y prepararlos, desarrollar un modelo de deep learning capaz de detectar estas conexiones y luego implementar y desplegar el modelo en la nube pública. \n \nEn la primera parte del trabajo, se exploran los conjuntos de datos CIC-DDoS2019 y CIC-IDS2017 del Canadian Institute for Cybersecurity. Se eliminan y corrigen valores atípicos y se seleccionan variables utilizando técnicas como Random Forest y la importancia de variables para reducir la dimensionalidad del conjunto de datos. Posteriormente, se implementa y entrena una red FNN siguiendo la arquitectura ResNet. \n \nEn la segunda sección, se desarrolla un panel de control que permite visualizar un informe de las conexiones después de pasar por el modelo. Este panel se despliega en la nube de AWS, junto con un backend que proporciona información a la página web y otros mecanismos para la limpieza de datos y la recopilación en tiempo real. \n \nAbstract: \n \nDDoS (Denial of Service) attacks have been a persistent threat in cyberspace since the 1990s, with their sophistication and frequency steadily increasing. These attacks involve the malicious saturation of network resources or computer systems, resulting in service disruption for legitimate users. This activity not only poses an economic problem for businesses but when the targets are critical infrastructures such as communication or healthcare systems, these attacks can be used as destabilization methods. \n \nCurrently, discerning whether a connection is legitimate or not is challenging. Systems may struggle to handle the volume of traffic generated in these attacks and tend to produce false positives, thus blocking legitimate connections. The objective of this work is to collect data, clean and prepare it, develop a deep learning model capable of detecting these connections, and then implement and deploy the model in the public cloud. \n \nIn the first part of the work, datasets such as CIC-DDoS2019 and CIC-IDS2017 from the Canadian Institute for Cybersecurity are explored. Outliers are removed and corrected, and variables are selected using techniques like Random Forest and variable importance to reduce the dimensionality of the dataset. Subsequently, a FNN network following the ResNet architecture is implemented and trained. \n \nIn the second section, a control panel is developed that allows visualization of a report of connections after passing through the model. This panel is deployed on the AWS cloud, along with a backend that provides information to the webpage and other mechanisms for real-time data cleaning and collection.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction distillée sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Apprise à partir de 10 348 étiquettes directes de Codex et de 10 348 étiquettes directes de Gemma. Le mode candidate est l'union des têtes enseignantes seuillées; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont ni des étiquettes humaines ni des étiquettes directes de modèles de pointe.
Scores Codex et Gemma par catégorie
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,001 | 0,000 |
| Méta-épidémiologie (sens strict) | 0,001 | 0,001 |
| Méta-épidémiologie (sens large) | 0,001 | 0,001 |
| Bibliométrie | 0,001 | 0,001 |
| Études des sciences et des technologies | 0,001 | 0,000 |
| Communication savante | 0,001 | 0,001 |
| Science ouverte | 0,002 | 0,001 |
| Intégrité de la recherche | 0,001 | 0,001 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,000 | 0,000 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule tête enseignante, pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».