{"id":"W4402126847","doi":"10.1016/j.jempfin.2024.101538","title":"Pooling and winsorizing machine learning forecasts to predict stock returns with high-dimensional data","year":2024,"lang":"en","type":"article","venue":"Journal of Empirical Finance","topic":"Stock Market Forecasting Methods","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"University of Denver","keywords":"Predictability; Machine learning; Pooling; Artificial intelligence; Computer science; Gradient boosting; Elastic net regularization; Robustness (evolution); Lasso (programming language); Random forest; Econometrics; Artificial neural network; Boosting (machine learning); Stock market; Economics; Statistics; Feature selection; Mathematics","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0118809,0.001153401,0.001494963,0.001089985,0.0005291906,0.001128588,0.0009016649,0.0008699396,0.0006533671],"category_scores_gemma":[0.01794179,0.0003091947,0.00116028,0.0009697654,0.0007403285,0.002056543,0.001530025,0.001553375,0.0002612568],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004296624,"about_ca_system_score_gemma":0.001123987,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007344265,"about_ca_topic_score_gemma":0.007365738,"domain_scores_codex":[0.9984909,0.0006907524,0.0001157192,0.0002717163,0.0002591741,0.0001717564],"domain_scores_gemma":[0.99082,0.005614798,0.0008634665,0.001627766,0.0006741221,0.0003999757],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0009464297,0.0004062286,0.07358206,0.0001210935,0.0009722452,0.0001921193,0.0001769623,0.7991102,0.002807904,0.003061779,0.004274892,0.114348],"study_design_scores_gemma":[0.00003021139,0.0001880479,0.007197913,0.00001601123,0.00005301575,0.00002228695,0.00004082092,0.9883211,0.001408695,0.00234985,0.000352245,0.00001980982],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.919539,0.0008666377,0.07575504,0.0007289828,0.0001353808,0.00005939521,0.0006616504,0.0007597997,0.001494074],"genre_scores_gemma":[0.9811212,0.0001347326,0.01675459,0.0001314307,0.0001130988,0.00003079325,0.001353674,0.00003101144,0.0003294469],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.0118809,"threshold_uncertainty_score":0.06283295,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1893237070993366,"score_gpt":0.4380208558987659,"score_spread":0.2486971487994293,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}