{"id":"W2163019878","doi":"10.1177/1555343414532813","title":"Exploring the Use of Categories in the Assessment of Airline Pilots’ Performance as a Potential Source of Examiners’ Disagreement","year":2014,"lang":"en","type":"article","venue":"Journal of Cognitive Engineering and Decision Making","topic":"Human-Automation Interaction and Safety","field":"Psychology","cited_by":20,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Victoria","funders":"Griffith University","keywords":"Aviation; Aviation accident; Psychology; Applied psychology; Aviation safety; Computer science; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1519472,0.000566753,0.0009192266,0.006711351,0.002421608,0.004659046,0.001586596,0.001338403,0.0005322397],"category_scores_gemma":[0.3907918,0.0006683335,0.0009434395,0.002414051,0.004675856,0.002531622,0.006550982,0.001495157,0.0001738602],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002260164,"about_ca_system_score_gemma":0.00199024,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00465958,"about_ca_topic_score_gemma":0.005050386,"domain_scores_codex":[0.794912,0.1486363,0.01985055,0.006836915,0.02695784,0.002806356],"domain_scores_gemma":[0.4557998,0.4359058,0.03657296,0.01881042,0.04986355,0.003047517],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"observational","study_design_scores_codex":[0.0007354235,0.0001555585,0.4373236,0.0007272317,0.0005423381,0.0009549289,0.4864083,0.0008096157,0.007149318,0.002732882,0.0008480291,0.06161274],"study_design_scores_gemma":[0.0001259319,0.001099346,0.5167018,0.001874311,0.0003887174,0.003044285,0.433345,0.01005027,0.009218919,0.01142763,0.01227537,0.0004484699],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9871386,0.0007547882,0.008643554,0.0006510157,0.00007622472,0.0001356967,0.00004174509,0.00003070836,0.002527687],"genre_scores_gemma":[0.9957811,0.0001528945,0.003523077,0.0001554576,0.00002985372,0.0001125883,0.00004687413,0.00001436335,0.000183911],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1519472,"threshold_uncertainty_score":0.803583,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.09387926552206022,"score_gpt":0.3587214757991561,"score_spread":0.2648422102770959,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}