MétaCan
Menu
Retour à la cohorte
Enregistrement W7028702812

Estimation des coûts de constructions de routes en utilisant l'apprentissage automatique explicable

2022· other· fr· W7028702812 sur OpenAlexaboutno aff

Notice bibliographique

RevuePolyPublie (École Polytechnique de Montréal) · 2022
Typeother
Languefr
Domaine
Thématique
Établissements canadiensnon disponible
Organismes subventionnairesnon disponible
Mots-clésRail transportationTransportation infrastructureFederal state
DOInon disponible

Résumé

récupéré en direct d'OpenAlex

RÉSUMÉ: L'estimation préalable des coûts est une étape cruciale lors de la réalisation d'un projet de construction d'infrastructures de transports. Une estimation de qualité assure une meilleure planification de projet, une gestion des fonds adéquate et une prise de décision éclairée. En effet, il est commun de sélectionner une solution à un projet routier via la publication d'appels d'offres. Généralement, un projet regroupe différentes tâches et un appel d'offres sera émis pour chacune d'entre elles. Une compétition émerge entre les différents soumissionnaires. Cette compétition étant publique, elle peut potentiellement influencer les coûts suggérés. Ainsi, avant toute prise de décision, les chargés de projet doivent anticiper le coût raisonnable attendu pour un certain appel d'offres. Si le coût suggéré par les soumissionnaires est estimé à la baisse, le service offert risque d'être d'une qualité médiocre. À l'inverse, un coût surestimé se traduirait par une mauvaise gestion des fonds publics. Bref, on cherche à accepter un prix qui serait des plus justes. Les chargés de projet doivent également justifier leur choix de soumissionnaire de manière objective et compréhensible. Offrir une estimation préalable des coûts claire et justifiée représente un défi pour ces derniers. Au ministère des Transports du Québec, l'approche utilisée combine une analyse statistique des coûts historiques et l'avis d'experts en estimation. Or, le Vérificateur Général du Québec a soulevé des doutes quant à l'exactitude de ces estimations. De plus, ce dernier soulève son manque de transparence. Des approches plus modernes utilisent l'intelligence artificielle pour accomplir cette même tâche. Plus particulièrement, l'apprentissage automatique supervisé est fort utile pour faire de telles prédictions en présence de données numériques historiques. Toutefois, la conception d'un modèle d'apprentissage automatique étant à la fois performant et explicable est un défi dans l'état de l'art. Un autre défi lié à l'utilisation de l'apprentissage automatique est qu'un modèle entraîné à prédire les coûts pour une tâche en particulier ne sera pas forcément approprié pour une tâche tierce. La solution proposée affronte ces différents défis. D'abord, ce mémoire propose un pipeline d'optimisation de la performance des modèles d'apprentissage automatique. Les premières étapes de ce pipeline visent à améliorer la qualité des données en vue de son utilisation avec le modèle étudié. Pour ce faire, on propose différentes techniques de mise à l'échelle des données, on procède à une sélection de variables rigoureuse via un algorithme d'élimination récursive des variables et on effectue une détection automatique des valeurs aberrantes. L'étape finale du pipeline d'optimisation permet de sélectionner les meilleurs hyperparamètres du modèle. Au travers de ce processus, chaque étape valide sa configuration à l'aide d'une validation croisée adaptée à notre problème. ABSTRACT: Preliminary cost estimation is a predominant factor for the success of a road construction project. It supports the project planning, proper funds management and the decision-making process. The decision-making process usually goes by independent calls for tenders for each sub-task associated with a project. From this call emerges a competition between the various subcontractors. This competition being public, it impacts the price suggested by the several submissions. Prior to making a decision, project planners need to anticipate the fair price expected for a project. If the price given is too low, we risk having poor quality of service. Conversely, we risk paying an unnecessary amount if prices are higher than expected. Moreover, project planners need to justify their acceptance of a certain bidder to stakeholders in an objective and clear manner. This transparency is paramount to avoid illegal collusion. It also helps to identify the most influential factors in a project's cost. Having an estimation that is both of quality and transparent is a challenge for a project executive. In Quebec's Ministry of Transportation (MTQ), the task is carried out by a combination of an analysis of historical cost and expert knowledge. The latter method was however the object of doubts and questions regarding both its transparency and its correctness by the Auditor General of Quebec. A modern approach is to use a model based on artificial intelligence, and more precisely supervised learning. Having a supervised learning model that is both explainable and precise is nonetheless a challenge in literature. Another challenge is that a model trained to forecast cost for a specific sub-task may not be suitable for another sub-task. Our approach tackles those challenges. First, we propose a full pipeline for optimizing performance of six machine learning models (decision tree, random forest, XGBoost, CatBoost, neural networks, and ensemble voters). The pipeline presents methods for enhancing data quality. In particular, we use scaling techniques, rigorous feature selection through the algorithm of recursive feature elimination and automatic outliers' detection. Besides, the final step of the pipeline ensures an optimal configuration of the model by tuning hyperparameters. Throughout this process, the quality of the model is ensured using a customized cross-validation based technique. Each one of the six models is independently trained and optimized for each sub-task of the experiment. Second, we use a method based on Shapley Additive Explanations to justify any of the prediction made by our models. Two types of visual explanations are provided. The first one describes the impact that each feature had for a specific estimation. The second one compares the impact of the features with one another among all the predictions.

Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.

Comment cette classification a été obtenuedéplier

Prédiction machine sur la base complète

Imitation des enseignants

Ni prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.

score de la tête « metaresearch » (Codex)0,001
score de la tête « metaresearch » (Gemma)0,004
Version: metacan-v3-hybrid-931329e0061cStatut de validation: machine_predicted_unvalidated
Catégories candidatesaucune
Catégories consensuellesaucune
DomaineSignal candidat: aucune · Signal consensuel: aucune
Devis d'étudeSignal candidat: Simulation ou modélisation · Signal consensuel: Simulation ou modélisation
GenreSignal candidat: Empirique · Signal consensuel: Empirique
Score de désaccord entre enseignants0,018
Score d'incertitude au seuil0,035

Scores du classifieur distillé par catégorie (deux têtes)

CatégorieCodexGemma
Métarecherche0,0010,004
Méta-épidémiologie (sens strict)0,0010,000
Méta-épidémiologie (sens large)0,0010,001
Bibliométrie0,0020,003
Études des sciences et des technologies0,0010,000
Communication savante0,0020,001
Science ouverte0,0010,001
Intégrité de la recherche0,0010,001
Charge utile insuffisante (le modèle a refusé de juger)0,0070,002

Scores machine (provisoires)

Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.

Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.

Tête enseignante Opus0,010
Tête enseignante GPT0,244
Écart entre enseignants0,233 · la distance entre les deux têtes enseignantes sur ce seul travail
Statut de validationscore_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découle

Classification

machine, non validée

Prédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.

Les modèles n’ont appliqué aucune catégorie : rien dans la taxonomie ne correspondait à ce travail.
Devis d'étudeSimulation ou modélisation
Domainenon disponible
GenreEmpirique

Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».

En bref

Citations0
Publié2022
Routes d'admission1
Résumé présentoui

Explorer davantage

Même revuePolyPublie (École Polytechnique de Montréal)Travaux en français237 207