{"id":"W2148623326","doi":"10.1111/j.1365-2923.2012.04289.x","title":"Using automatic item generation to create multiple‐choice test items","year":2012,"lang":"en","type":"article","venue":"Medical Education","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":142,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Computer science; Multiple choice; Licensure; Item bank; Context (archaeology); Test (biology); Certification; Item response theory; Process (computing); Artificial intelligence; Machine learning; Information retrieval; Psychometrics; Psychology; Medical education; Medicine","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02882681,0.002079056,0.001063337,0.004488348,0.0007457681,0.001679938,0.002496212,0.001283766,0.00591727],"category_scores_gemma":[0.1386919,0.0008829209,0.001288673,0.003050711,0.001023258,0.001710881,0.002170047,0.00171965,0.002137759],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001131322,"about_ca_system_score_gemma":0.001745244,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00110765,"about_ca_topic_score_gemma":0.001401192,"domain_scores_codex":[0.9722748,0.02075277,0.001501842,0.00174854,0.003472572,0.000249363],"domain_scores_gemma":[0.7962414,0.167231,0.005303172,0.01403792,0.01650837,0.0006781085],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000603206,0.001101071,0.02049997,0.0009683241,0.0003681341,0.0003720138,0.00279919,0.03598256,0.01460681,0.01118275,0.00764716,0.9038687],"study_design_scores_gemma":[0.001186638,0.00209946,0.02678665,0.0006175482,0.0003696245,0.001354717,0.0009979833,0.837029,0.05436263,0.05035126,0.02446008,0.0003844641],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02397892,0.00006151485,0.9699323,0.0001153794,0.00004481472,0.0017455,0.0002239232,0.002674722,0.001222827],"genre_scores_gemma":[0.0853012,0.00005168257,0.9102274,0.00007521699,0.00002405439,0.002911716,0.0006728244,0.0003122934,0.0004235649],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.02882681,"threshold_uncertainty_score":0.1524525,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.6054844956655376,"score_gpt":0.5574866617688159,"score_spread":0.04799783389672174,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}