{"id":"W4405373825","doi":"10.2147/amep.s478193","title":"Assessing the Difficulty and Long-Term Retention of Factual and Conceptual Knowledge Through Multiple-Choice Questions: A Longitudinal Study","year":2024,"lang":"en","type":"article","venue":"Advances in Medical Education and Practice","topic":"Clinical Reasoning and Diagnostic Skills","field":"Medicine","cited_by":7,"is_retracted":false,"has_abstract":true,"ca_institutions":"Office of the Chief Medical Examiner","funders":"","keywords":"Term (time); Psychology; Computer science; Data science; Information retrieval","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006867797,0.000442044,0.0005657004,0.001397144,0.0008610262,0.0011977,0.0006196018,0.0009098268,0.0009810242],"category_scores_gemma":[0.01817673,0.0003376414,0.0007562609,0.0007445049,0.0005278086,0.001598827,0.00100244,0.001259133,0.0005351487],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005910483,"about_ca_system_score_gemma":0.000619981,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004072081,"about_ca_topic_score_gemma":0.003166921,"domain_scores_codex":[0.9985038,0.0003998103,0.000179903,0.0002683319,0.0004603957,0.0001878271],"domain_scores_gemma":[0.9841896,0.002986185,0.006118295,0.001416288,0.003689651,0.001600065],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0005077432,0.0009510436,0.9866997,0.00002455038,0.0001010038,0.00010367,0.001162717,0.00009832906,0.0006643633,0.00002882896,0.0001411542,0.009516856],"study_design_scores_gemma":[0.00002637537,0.003609544,0.9929917,0.00002477382,0.00008618526,0.0003129347,0.0006393799,0.0006653095,0.0009482007,0.00007340891,0.0005912835,0.00003096311],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.999161,0.0001997726,0.0002787923,0.00002654348,0.000006370412,0.00003114998,0.0001229562,0.000005180017,0.0001682544],"genre_scores_gemma":[0.9984367,0.0001084779,0.0003266284,0.00002545249,0.00001096595,0.00006029592,0.0004770543,0.000004307139,0.0005500792],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.006867797,"threshold_uncertainty_score":0.03632081,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0860952689917893,"score_gpt":0.5197427523275574,"score_spread":0.4336474833357681,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}