MétaCan
Menu
Retour à la cohorte
Enregistrement W4411220608 · doi:10.1002/nav.22270

Improved Regression Tree Models Using Generalization Error‐Based Splitting Criteria

2025· article· en· W4411220608 sur OpenAlexaff
Yang Ying, Shuaian Wang, Gilbert Laporte

Notice bibliographique

RevueNaval Research Logistics (NRL) · 2025
Typearticle
Langueen
DomaineMathematics
ThématiqueStatistical Methods and Inference
Établissements canadiensHEC Montréal
Organismes subventionnairesnon disponible
Mots-clésGeneralizationRegressionStatisticsTree (set theory)Computer scienceGeneralization errorMathematicsArtificial intelligenceMachine learningCombinatoricsArtificial neural network

Résumé

récupéré en direct d'OpenAlex

ABSTRACT Despite the widespread application of machine learning (ML) approaches such as the regression tree (RT) in the field of data‐driven optimization, overfitting may impair the effectiveness of ML models and thus hinder the deployment of ML for decision‐making. In particular, we address the overfitting issue of the traditional RT splitting criterion with a limited sample size, which considers only the training mean squared error, and we accurately specify the mathematical formula for the generalization error. We introduce two novel splitting criteria based on generalization error, which offer higher‐quality approximations of the generalization error than the traditional training error does. One criterion is formulated through a mathematical derivation based on the RT model, and the second is established through leave‐one‐out cross‐validation (LOOCV). We construct RT models using our proposed generalization error‐based splitting criteria from extensive ML benchmark instances and report the experimental results, including the models' computational efficiency, prediction accuracy, and robustness. Our findings endorse the superior efficacy and robustness of the RT model based on the refined LOOCV‐informed splitting criterion, marking substantial improvements over those of the traditional RT model. Additionally, our tree structure analysis provides insights into how our proposed LOOCV‐informed splitting criterion guides the model in striking a balance between a complex tree structure and accurate predictions.

Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.

Comment cette classification a été obtenuedéplier

Prédiction distillée sur la base complète

Imitation des enseignants

Ni prévalence calibrée, ni vérité terrain. Validation humaine à venir. Apprise à partir de 10 348 étiquettes directes de Codex et de 10 348 étiquettes directes de Gemma. Le mode candidate est l'union des têtes enseignantes seuillées; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont ni des étiquettes humaines ni des étiquettes directes de modèles de pointe.

score de la tête « metaresearch » (Codex)0,004
score de la tête « metaresearch » (Gemma)0,033
Version: codex-gemma-dda1882f352aStatut de validation: machine_predicted_unvalidated
Catégories candidatesMétarecherche
Catégories consensuellesaucune
DomaineSignal candidat: aucune · Signal consensuel: aucune
Devis d'étudeSignal candidat: Théorique ou conceptuel · Signal consensuel: aucune
GenreSignal candidat: Méthodes · Signal consensuel: Méthodes
Score de désaccord entre enseignants0,583
Score d'incertitude au seuil0,975

Scores Codex et Gemma par catégorie

CatégorieCodexGemma
Métarecherche0,0040,033
Méta-épidémiologie (sens strict)0,0000,000
Méta-épidémiologie (sens large)0,0000,000
Bibliométrie0,0000,001
Études des sciences et des technologies0,0000,000
Communication savante0,0000,000
Science ouverte0,0000,000
Intégrité de la recherche0,0000,001
Charge utile insuffisante (le modèle a refusé de juger)0,0000,000

Scores machine (provisoires)

Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.

Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.

Tête enseignante Opus0,578
Tête enseignante GPT0,582
Écart entre enseignants0,004 · la distance entre les deux têtes enseignantes sur ce seul travail
Statut de validationscore_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découle

Classification

machine, non validée

Prédiction automatique; un appel candidat d’une seule tête enseignante, pas un consensus.

Devis d'étudeThéorique ou conceptuel
Domainenon disponible
GenreMéthodes

Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».

En bref

Citations0
Publié2025
Routes d'admission1
Résumé présentoui

Explorer davantage

Même revueNaval Research Logistics (NRL)Même sujetStatistical Methods and InferenceTravaux en français237 207