{"id":"W3164655521","doi":"10.1016/j.nepr.2021.103085","title":"Automated essay scoring (AES) of constructed responses in nursing examinations: An evaluation","year":2021,"lang":"en","type":"article","venue":"Nurse Education in Practice","topic":"Clinical Reasoning and Diagnostic Skills","field":"Medicine","cited_by":18,"is_retracted":false,"has_abstract":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Reliability (semiconductor); Cohort; Medicine; Psychology; Pathology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.001911199,0.00008597508,0.0002045966,0.0002946296,0.0000311305,0.00002422134,0.00004531763,0.0001085211,0.0002053457],"category_scores_gemma":[0.2772586,0.0000965048,0.00002382204,0.0008327169,0.00008450974,0.0004059052,0.000005174288,0.0002314352,0.000009932231],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003947731,"about_ca_system_score_gemma":0.00560349,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000188937,"about_ca_topic_score_gemma":0.00003183168,"domain_scores_codex":[0.9977366,0.0009407537,0.0005265694,0.000272857,0.0003886914,0.0001345629],"domain_scores_gemma":[0.9845674,0.01346139,0.0002845126,0.0003501354,0.001240551,0.00009602519],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.001026897,0.01347752,0.388285,0.0000682926,0.00004385881,0.00005207725,0.01074777,0.0003076844,0.006083698,0.0114488,0.001067339,0.567391],"study_design_scores_gemma":[0.002471918,0.0001406592,0.9360312,0.006363173,0.0002763317,0.000244693,0.03913805,0.01043573,0.003741913,0.0009039601,0.0001231977,0.000129222],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9780867,0.00054989,0.00003524297,0.003299181,0.0009408845,0.0003476343,0.000002556679,0.00005979574,0.01667812],"genre_scores_gemma":[0.989117,0.00006745665,0.01007249,0.0002531306,0.00008364936,0.00005643612,0.0001257633,0.00001243369,0.0002116553],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.5672618,"threshold_uncertainty_score":0.994035,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04273014382337106,"score_gpt":0.4885102855207469,"score_spread":0.4457801416973759,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}