{"id":"W4412975185","doi":"10.31234/osf.io/a7kdx_v6","title":"The Forecasting Proficiency Test: A General Use Assessment of Forecasting Ability","year":2025,"lang":"en","type":"article","venue":"","topic":"Forecasting Techniques and Applications","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Variance (accounting); Probabilistic logic; Computer science; Test (biology); Variety (cybernetics); Probabilistic forecasting; Machine learning; Econometrics; Artificial intelligence; Bayesian probability; Economics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001984259,0.0006345105,0.0004832819,0.002085448,0.0003604455,0.001119994,0.0006307425,0.0009801175,0.005099405],"category_scores_gemma":[0.01542184,0.0001579856,0.0006595788,0.001041596,0.0005046125,0.00176132,0.0008462443,0.0009604206,0.002072306],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003849055,"about_ca_system_score_gemma":0.0005910615,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003179292,"about_ca_topic_score_gemma":0.003284343,"domain_scores_codex":[0.9989225,0.0002167084,0.0001510422,0.000167348,0.0003909201,0.0001514776],"domain_scores_gemma":[0.991271,0.003172316,0.002522211,0.0006467245,0.001411228,0.0009765589],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0004064681,0.00118807,0.8648596,0.00009380335,0.0001987431,0.0002444309,0.0008913149,0.002725012,0.001560492,0.001628634,0.01941814,0.1067854],"study_design_scores_gemma":[0.00006035061,0.001156386,0.9755078,0.00006266727,0.00005705626,0.000490666,0.0005014245,0.008345236,0.002137841,0.003116499,0.008497752,0.00006636087],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9647839,0.0002927649,0.007798574,0.0008977315,0.0001267662,0.0004454572,0.005374677,0.0003729207,0.01990712],"genre_scores_gemma":[0.9838467,0.0003135825,0.005891951,0.0002738093,0.00006272422,0.0005333048,0.005326121,0.00004902781,0.003702925],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.005099405,"threshold_uncertainty_score":0.01705927,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2557744791340968,"score_gpt":0.4548820474820007,"score_spread":0.1991075683479039,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}