{"id":"W3172612656","doi":"10.1096/fasebj.2021.35.s1.03203","title":"The Brave New World of Anatomy: Using AI to Grade Practical Examinations","year":2021,"lang":"en","type":"article","venue":"The FASEB Journal","topic":"Innovations in Medical Education","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Hamilton Health Sciences; McMaster University; University of Toronto","funders":"","keywords":"Grading (engineering); Computer science; Correctness; Artificial intelligence; Set (abstract data type); Spell; Syllabus; Curriculum; Natural language processing; Mathematics education; Psychology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008847798,0.000520684,0.0004004623,0.003265939,0.0006320333,0.003911643,0.0008551013,0.0006281479,0.001576603],"category_scores_gemma":[0.05221117,0.0003049881,0.0002461709,0.001643776,0.0009980757,0.004182194,0.001398489,0.0009700042,0.0007390572],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001130778,"about_ca_system_score_gemma":0.0009699843,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003741277,"about_ca_topic_score_gemma":0.008502492,"domain_scores_codex":[0.992658,0.004918309,0.0003961735,0.0007929388,0.001045338,0.0001892073],"domain_scores_gemma":[0.9688646,0.0243051,0.002160557,0.001695882,0.002436184,0.000537617],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.0005331336,0.0006428961,0.1316429,0.0002701725,0.00007521663,0.00008018513,0.005707309,0.003262278,0.007153277,0.00254894,0.004446402,0.8436374],"study_design_scores_gemma":[0.0002380253,0.00469354,0.5281249,0.0007119113,0.0002928938,0.0009226423,0.0228078,0.3156487,0.03852643,0.03852003,0.04906731,0.0004457058],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9066265,0.0007068413,0.075653,0.001356867,0.0001440165,0.0004477598,0.0002927044,0.0006522911,0.01411989],"genre_scores_gemma":[0.8875669,0.0003853701,0.1088758,0.000269837,0.00005709276,0.0001770272,0.000355163,0.00006290622,0.002249916],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.008847798,"threshold_uncertainty_score":0.04679221,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06189266896451422,"score_gpt":0.4204187538231602,"score_spread":0.358526084858646,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}