{"id":"W4416559616","doi":"10.31234/osf.io/a7kdx_v8","title":"The Forecasting Proficiency Test: A General Use Assessment of Forecasting Ability","year":2025,"lang":"","type":"article","venue":"","topic":"Forecasting Techniques and Applications","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Probabilistic logic; Probabilistic forecasting; Variance (accounting); Variety (cybernetics); Bayesian probability; Test (biology)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch","metaepi_narrow","sts","scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.01057179,0.0004665225,0.0006798243,0.0003425653,0.002431019,0.001300391,0.002453709,0.0002324384,0.0001845742],"category_scores_gemma":[0.02229888,0.0002887335,0.0004877573,0.004136186,0.001241982,0.0005575784,0.001503412,0.0005964254,0.000006686064],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002428115,"about_ca_system_score_gemma":0.001284374,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0004326768,"about_ca_topic_score_gemma":0.0001883972,"domain_scores_codex":[0.992652,0.0003524452,0.003162126,0.001298498,0.001554392,0.0009805526],"domain_scores_gemma":[0.9743875,0.01949618,0.00145687,0.002447913,0.002032694,0.0001788805],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00002787217,0.0008003989,0.2635623,0.0001059099,0.00005352549,0.000003071621,0.0002390455,0.0009660074,0.002512076,0.2871554,0.008574829,0.4359995],"study_design_scores_gemma":[0.0002531197,0.0002790912,0.0299164,0.0002534632,0.00006192063,0.00001237627,0.0005026506,0.8970404,0.002184053,0.05951491,0.00968819,0.0002933925],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.5187081,0.0002333145,0.3961706,0.003300873,0.0007255594,0.003170797,0.0001144223,0.0002137581,0.07736259],"genre_scores_gemma":[0.8731549,0.00003551273,0.1147019,0.0001324473,0.00006891991,0.0002439454,0.000003164308,0.0000199886,0.01163916],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.8960744,"threshold_uncertainty_score":0.9999565,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2132503898232042,"score_gpt":0.4378919946550607,"score_spread":0.2246416048318565,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}