{"id":"W2160968678","doi":"10.1080/01421590802155597","title":"Quality assurance of item writing: During the introduction of multiple choice questions in medicine for high stakes examinations","year":2008,"lang":"en","type":"article","venue":"Medical Teacher","topic":"Medical Education and Admissions","field":"Medicine","cited_by":52,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"University of Alberta","keywords":"Quality assurance; Medical education; Quality (philosophy); MEDLINE; Psychology; Medicine; Political science; Epistemology; Pathology","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.001429955,0.0001002834,0.0003845669,0.0001177082,0.0001088283,0.000001166164,0.0001287118,0.0001267378,0.003462095],"category_scores_gemma":[0.1167369,0.00006376258,0.00006098673,0.0003629925,0.0005544048,0.00004459201,0.0000187832,0.0003789109,0.000001590754],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00005778002,"about_ca_system_score_gemma":0.0004369429,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000551781,"about_ca_topic_score_gemma":0.000123713,"domain_scores_codex":[0.99796,0.0002088047,0.0007619236,0.0002075549,0.0006866739,0.0001750139],"domain_scores_gemma":[0.9971957,0.001637099,0.0002080504,0.0003264804,0.000241958,0.0003906746],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0001777334,0.002962882,0.9234786,0.001201409,0.0001043513,0.000009673418,0.006633744,0.00001073645,0.01142302,0.004413356,0.04112984,0.008454674],"study_design_scores_gemma":[0.002699363,0.0001050812,0.9751437,0.000378627,0.00003040959,0.0000312081,0.001358104,0.0006818603,0.0007500583,0.00008907554,0.01865874,0.00007377253],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9331765,0.0002571786,0.0009307721,0.06447455,0.0002231508,0.0004023115,0.000005944906,0.00002901075,0.0005005747],"genre_scores_gemma":[0.9944521,0.000099897,0.0004653378,0.0002542834,0.001004566,0.00008121686,0.00004603249,0.00001176915,0.003584825],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1153069,"threshold_uncertainty_score":0.9974489,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.08315160042075002,"score_gpt":0.3920798300413271,"score_spread":0.308928229620577,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}