{"id":"W2169966878","doi":"10.1186/1472-6920-4-23","title":"The impact of two multiple-choice question formats on the problem-solving strategies used by novices and experts","year":2004,"lang":"en","type":"article","venue":"BMC Medical Education","topic":"Clinical Reasoning and Diagnostic Skills","field":"Medicine","cited_by":73,"is_retracted":false,"has_abstract":true,"ca_institutions":"Foothills Medical Centre; Health Sciences Centre; University of Calgary","funders":"","keywords":"Multiple choice; Think aloud protocol; Computer science; Psychometrics; Matching (statistics); Pencil (optics); Test (biology); Educational measurement; Mathematics education; Management science; Psychology; Curriculum; Mathematics; Statistics; Human–computer interaction; Clinical psychology; Pedagogy","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.0007773749,0.0001083734,0.0001565272,0.00002527026,0.0001326278,0.00004930477,0.00009557858,0.00008656715,0.00004582879],"category_scores_gemma":[0.07496894,0.00004977972,0.00006541811,0.0000993351,0.000193913,0.00008688868,0.00001818423,0.0001721805,0.000004629176],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00007271601,"about_ca_system_score_gemma":0.002040199,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003363736,"about_ca_topic_score_gemma":0.0005442802,"domain_scores_codex":[0.9988421,0.00009862115,0.0003145026,0.000151617,0.0004259025,0.0001673065],"domain_scores_gemma":[0.9748759,0.02441441,0.0001568618,0.0002227454,0.00009929324,0.0002307838],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.001005422,0.007204382,0.7033776,0.0004408964,0.0002720627,0.000004010106,0.01896838,0.0006213786,0.003647983,0.03647156,0.03837162,0.1896147],"study_design_scores_gemma":[0.01097401,0.002807094,0.9184887,0.01884188,0.0002259945,0.0001142766,0.01981778,0.006159503,0.001989585,0.01913783,0.0009298509,0.0005134582],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.99227,0.0006836312,0.0004078602,0.005371035,0.000147428,0.0003782351,0.000001908116,0.00002696407,0.000712938],"genre_scores_gemma":[0.9986215,0.0002207402,0.0003589869,0.0004486395,0.0002076461,0.00005570854,0.00002862581,0.000009200963,0.00004897671],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.2151112,"threshold_uncertainty_score":0.932823,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02945401467417535,"score_gpt":0.4096948106071412,"score_spread":0.3802407959329658,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}