{"id":"W4398201102","doi":"10.3138/jvme-2023-0162","title":"A Comparison of Machine-Graded (ChatGPT) and Human-Graded Essay Scores in Veterinary Admissions","year":2024,"lang":"en","type":"article","venue":"Journal of Veterinary Medical Education","topic":"Medical Education and Admissions","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Prince Edward Island","funders":"","keywords":"Rubric; Grading (engineering); Cognition; Psychology; Pairwise comparison; Artificial intelligence; Applied psychology; Computer science; Developmental psychology; Mathematics education","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.01895946,0.0003540809,0.0003900939,0.004291355,0.0004806467,0.001928485,0.000801896,0.0005945275,0.0009920672],"category_scores_gemma":[0.1091898,0.0002287065,0.0004328012,0.002516379,0.001076866,0.001311769,0.002686646,0.000643551,0.0006185654],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009749927,"about_ca_system_score_gemma":0.0006047376,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001901217,"about_ca_topic_score_gemma":0.004201582,"domain_scores_codex":[0.9793451,0.01024334,0.002230884,0.001808831,0.005792516,0.000579242],"domain_scores_gemma":[0.9000495,0.05379225,0.0175312,0.005305589,0.01957328,0.003748219],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0009510932,0.0002029358,0.922714,0.0001140876,0.0001640651,0.0001320263,0.006981193,0.001368153,0.001927167,0.0004454022,0.0007018777,0.06429798],"study_design_scores_gemma":[0.00002040573,0.000823231,0.9883774,0.00004541692,0.00002404406,0.0001551961,0.003082507,0.004172304,0.002000862,0.0003688417,0.000887087,0.00004267269],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9958424,0.00006032501,0.001763272,0.00003647212,0.00003141306,0.00004686222,0.0001347337,0.00003092885,0.002053506],"genre_scores_gemma":[0.9983099,0.00002378763,0.001072679,0.00001632169,0.0000149172,0.00003635769,0.0001516959,0.000008539675,0.0003659409],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9810405,"threshold_uncertainty_score":0.1002684,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1219182681896979,"score_gpt":0.488186711049233,"score_spread":0.3662684428595351,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}