{"id":"W4404293607","doi":"10.36834/cmej.72320","title":"User experience of the Written Exam Question Quality tool to inform the writing of new written-exam questions","year":2024,"lang":"en","type":"article","venue":"Canadian Medical Education Journal","topic":"Student Assessment and Feedback","field":"Social Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université de Sherbrooke","funders":"","keywords":"Task (project management); Perception; Quality (philosophy); Computer science; Test (biology); Psychology; Medical education; Medicine","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":true,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.002660902,0.00007856933,0.0001198167,0.0001283199,0.0007357516,0.0001982426,0.0006287572,0.0001073101,0.004226446],"category_scores_gemma":[0.0081671,0.00005172711,0.0000876223,0.0007837653,0.0002967007,0.0002929133,0.00003162065,0.0004232466,0.00001758087],"about_ca_system_candidate":true,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000361124,"about_ca_system_score_gemma":0.02852395,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_topic_score_codex":0.1028093,"about_ca_topic_score_gemma":0.09926599,"domain_scores_codex":[0.9977817,0.0002505542,0.0005003177,0.0001135292,0.0010855,0.0002684086],"domain_scores_gemma":[0.9977428,0.0002020445,0.0001261843,0.0001693714,0.0003138444,0.001445751],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","study_design_scores_codex":[0.000007758896,0.00008975688,0.05470614,0.00004330923,0.00005626072,0.000003925184,0.175986,0.000008903828,0.00008584488,0.2847833,0.212545,0.2716838],"study_design_scores_gemma":[0.000111179,0.00002671001,0.2988453,0.0006160124,0.00002942972,0.00002042369,0.08693171,0.00003722298,0.00001755508,0.001502263,0.6117234,0.0001387885],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7770072,0.0005017848,0.0002982305,0.2026709,0.00399002,0.0003814817,0.00000589892,0.00002040809,0.01512407],"genre_scores_gemma":[0.9889398,0.0001242265,0.0003957382,0.004804353,0.001488695,0.00001698048,0.000001704721,0.000007069098,0.004221497],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.3991784,"threshold_uncertainty_score":0.9966838,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03389104683518359,"score_gpt":0.4116215754441866,"score_spread":0.3777305286090031,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}