{"id":"W2001581855","doi":"10.1103/physrevstper.10.020120","title":"Comparison of integrated testlet and constructed-response question formats","year":2014,"lang":"en","type":"article","venue":"Physical Review Special Topics - Physics Education Research","topic":"Science Education and Pedagogy","field":"Social Sciences","cited_by":8,"is_retracted":false,"has_abstract":true,"ca_institutions":"Trent University","funders":"Brock University; Trent University","keywords":"Inter-rater reliability; Reliability (semiconductor); Set (abstract data type); Proxy (statistics); Multiple choice; Baseline (sea)","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02085151,0.0009246247,0.000818791,0.002616644,0.0002414311,0.002556632,0.001769481,0.001427923,0.006069037],"category_scores_gemma":[0.1559141,0.0003517676,0.0008655657,0.001792709,0.0006583861,0.003303639,0.002448181,0.001405348,0.00177145],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007851465,"about_ca_system_score_gemma":0.0007537072,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000570401,"about_ca_topic_score_gemma":0.0005637076,"domain_scores_codex":[0.9728776,0.01331758,0.003541039,0.002725806,0.006842385,0.0006955371],"domain_scores_gemma":[0.8090975,0.1453398,0.0117821,0.009700936,0.02075285,0.003326786],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.02451076,0.007608745,0.1844928,0.003467637,0.00126128,0.0005591297,0.007719516,0.01032906,0.04197519,0.006267414,0.006724685,0.7050838],"study_design_scores_gemma":[0.00313093,0.0562452,0.7636264,0.001667623,0.001164894,0.003119902,0.00431681,0.06203721,0.05764119,0.008114501,0.03841904,0.00051624],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9389254,0.0008306125,0.03861868,0.0003637919,0.000253461,0.002412301,0.002110709,0.001076193,0.01540904],"genre_scores_gemma":[0.9458732,0.0004202998,0.04126549,0.0004859907,0.00015366,0.002446781,0.005378755,0.0003219333,0.003653918],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02085151,"threshold_uncertainty_score":0.1102746,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1877132760863169,"score_gpt":0.5850961455017246,"score_spread":0.3973828694154077,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}