{"id":"W1594285860","doi":"","title":"The Most Dangerous Model: A Natural Benchmark for Assessing Model Risk","year":2015,"lang":"en","type":"article","venue":"SSRN Electronic Journal","topic":"Risk and Safety Analysis","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Benchmark (surveying); Natural (archaeology); Computer science; Risk analysis (engineering); Business; Geography; Cartography","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004380496,0.00100168,0.000964447,0.002979362,0.001345461,0.003100966,0.002055713,0.001999235,0.005060409],"category_scores_gemma":[0.02876377,0.0003081435,0.001158995,0.001043685,0.002055162,0.004456418,0.002293492,0.00282518,0.0004596064],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001705998,"about_ca_system_score_gemma":0.002721566,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003316701,"about_ca_topic_score_gemma":0.00374626,"domain_scores_codex":[0.996542,0.001703901,0.0001190922,0.0003524585,0.001061345,0.0002211726],"domain_scores_gemma":[0.9878308,0.007490338,0.001074275,0.001692334,0.001030656,0.0008815773],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0001859423,0.0001737883,0.003811346,0.0001195347,0.0001216581,0.0001635116,0.0001451114,0.5920779,0.001261181,0.3843429,0.005033499,0.01256353],"study_design_scores_gemma":[0.00003233615,0.0001700632,0.0005449647,0.00004897948,0.0000323323,0.00008890573,0.00008848609,0.6496331,0.0008183271,0.3462752,0.002233841,0.00003334362],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1813877,0.0003593872,0.7514341,0.00313816,0.0002377837,0.0002891191,0.002059182,0.0008252695,0.06026918],"genre_scores_gemma":[0.8734658,0.0002490622,0.1216429,0.0004208194,0.00009373028,0.0003014851,0.0009451494,0.0002333856,0.002647549],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.005060409,"threshold_uncertainty_score":0.02316654,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0603061295836417,"score_gpt":0.3703655743293625,"score_spread":0.3100594447457208,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}