{"id":"W2510347771","doi":"10.1021/acs.jchemed.6b00028","title":"Score Increase and Partial-Credit Validity When Administering Multiple-Choice Tests Using an Answer-Until-Correct Format","year":2016,"lang":"en","type":"article","venue":"Journal of Chemical Education","topic":"Student Assessment and Feedback","field":"Social Sciences","cited_by":15,"is_retracted":false,"has_abstract":true,"ca_institutions":"Trent University","funders":"Brock University","keywords":"Allotment; Test (biology); Post hoc; Multiple choice; Econometrics; Polytomous Rasch model; Statistics; Actuarial science; Computer science; Psychology; Mathematics; Economics; Medicine; Psychometrics; Internal medicine; Item response theory","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02242653,0.0005811401,0.0005864595,0.001191984,0.0003787763,0.001118188,0.0006188367,0.0008183503,0.005130247],"category_scores_gemma":[0.154824,0.0002521788,0.0009239105,0.00109745,0.001121084,0.001195487,0.001319585,0.001198494,0.001174616],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004050274,"about_ca_system_score_gemma":0.0008033966,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0007954729,"about_ca_topic_score_gemma":0.0022663,"domain_scores_codex":[0.9665477,0.01615391,0.002059049,0.001623223,0.01290566,0.0007105524],"domain_scores_gemma":[0.8166217,0.1387459,0.01994071,0.01238152,0.01020055,0.002109619],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.006993327,0.002699126,0.6133235,0.0006591983,0.0005163709,0.0001676903,0.002750284,0.003025477,0.03344869,0.001773143,0.002944262,0.3316989],"study_design_scores_gemma":[0.00009585417,0.01194568,0.9300401,0.000126344,0.0001175628,0.0004404077,0.0006028006,0.006072585,0.04510815,0.002075053,0.003287232,0.00008820334],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9704132,0.0001741193,0.01588344,0.0002855033,0.0001370482,0.0004616872,0.0002879772,0.0002258392,0.01213119],"genre_scores_gemma":[0.9763417,0.0001204072,0.0195814,0.0001690223,0.00006789331,0.000397688,0.0002715245,0.00007160965,0.002978759],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02242653,"threshold_uncertainty_score":0.1186042,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.09711035673035426,"score_gpt":0.3936019198884978,"score_spread":0.2964915631581435,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}