{"id":"W2060054786","doi":"10.1175/jcli-d-13-00457.1","title":"Surface Temperature Probability Distributions in the NARCCAP Hindcast Experiment: Evaluation Methodology, Metrics, and Results","year":2014,"lang":"en","type":"article","venue":"Journal of Climate","topic":"Climate variability and models","field":"Environmental Science","cited_by":23,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Hindcast; Climatology; Environmental science; Skewness; Climate model; Climate change; Percentile; Meteorology; Statistics; Geography; Mathematics; Geology","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01961111,0.00009833189,0.0002050036,0.00003561066,0.0001380217,0.00005261481,0.0002031929,0.00008512283,0.0000873274],"category_scores_gemma":[0.00244534,0.00006169032,0.00005814246,0.0002893606,0.0001674459,0.0002536754,0.00009860766,0.0002884124,0.000005983079],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000175691,"about_ca_system_score_gemma":0.00001587293,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0000633305,"about_ca_topic_score_gemma":0.00007984265,"domain_scores_codex":[0.9971294,0.001457074,0.0005959247,0.0001835224,0.0004295784,0.0002044974],"domain_scores_gemma":[0.9984419,0.0009004967,0.0003144412,0.0002321163,0.0000496866,0.00006131081],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.003884329,0.005422767,0.3537512,0.000312137,0.0001679944,0.00004092744,0.05685946,0.1548313,0.3412956,0.03226584,0.006393509,0.04477493],"study_design_scores_gemma":[0.01018411,0.001911523,0.735754,0.000214776,0.0004079936,0.0005296378,0.004361333,0.06907529,0.01482179,0.1400167,0.02180122,0.0009216225],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9949178,0.0001201976,0.0003187241,0.002912185,0.0001180487,0.0002538055,0.00003410851,0.000004124046,0.001321026],"genre_scores_gemma":[0.9916612,0.0001743131,0.008024078,0.00008920849,0.00003094479,0.000004168265,0.000008519491,0.000003750963,0.000003834132],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.3820028,"threshold_uncertainty_score":0.6796858,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.09548134239871503,"score_gpt":0.3552115101846428,"score_spread":0.2597301677859278,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}