{"id":"W2316009442","doi":"10.1177/154193120304700147","title":"Calibration of Confidence in Situation Awareness Queries","year":2003,"lang":"en","type":"article","venue":"Proceedings of the Human Factors and Ergonomics Society Annual Meeting","topic":"Human-Automation Interaction and Safety","field":"Psychology","cited_by":8,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo; Defence Research and Development Canada; Canadian Armed Forces","funders":"","keywords":"Overconfidence effect; Air traffic control; Confidence interval; Perception; Workload; Aviation; Task (project management); Computer science; Psychology; Calibration; Simulation; Social psychology; Statistics; Engineering; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0004075786,0.0001021315,0.0001794155,0.00003656902,0.0001769869,0.00002584234,0.0001052352,0.00009324139,0.0000711693],"category_scores_gemma":[0.0001130708,0.00008402891,0.00009101188,0.0001010062,0.0001268209,0.0002987882,0.00003258324,0.0001257543,4.238704e-7],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00003829672,"about_ca_system_score_gemma":0.00002057083,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0002892418,"about_ca_topic_score_gemma":0.00004080973,"domain_scores_codex":[0.9992002,0.00002107357,0.000412341,0.0001619648,0.00008537505,0.0001190454],"domain_scores_gemma":[0.9992844,0.00007937924,0.0004116799,0.0000567862,0.0001435423,0.00002422783],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00004618348,0.0001051072,0.5800293,0.0001584828,0.00005944096,2.784298e-8,0.1562389,0.00009705171,0.02460363,0.2376703,0.000901266,0.00009025914],"study_design_scores_gemma":[0.001032524,0.0001089128,0.6891187,0.0003171994,0.00004019443,0.000003914127,0.2246135,0.001044589,0.07698084,0.005402159,0.0009551481,0.0003822428],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9966912,0.00003095661,0.00005148751,0.00004611106,0.0001999198,0.0001213369,0.00001005167,0.00001658856,0.002832329],"genre_scores_gemma":[0.9995659,0.00001204211,0.0001330661,0.00003632825,0.00002015427,0.000007541961,0.000002452781,0.000008805362,0.000213684],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.2322682,"threshold_uncertainty_score":0.3426599,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02761251143653697,"score_gpt":0.3044137519517995,"score_spread":0.2768012405152625,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}