{"id":"W1982491995","doi":"10.3138/cmlr.1723.359","title":"Relating a Reading Comprehension Test to the CEFR Levels: A Case of Standard Setting in Practice with Focus on Judges and Items","year":2013,"lang":"en","type":"article","venue":"Canadian Modern Language Review/ La Revue canadienne des langues vivantes","topic":"Second Language Learning and Teaching","field":"Arts and Humanities","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Test (biology); Context (archaeology); Focus (optics); Set (abstract data type); Reading (process); Psychology; Reading comprehension; Language assessment; Computer science; Comprehension; Mathematics education; Linguistics; Medical education; Natural language processing; Medicine; History","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0008064011,0.0002505454,0.0004258771,0.0002571669,0.0003700785,0.0001690531,0.0001668331,0.00005181162,0.0001835663],"category_scores_gemma":[0.002784521,0.0001760098,0.0000499677,0.0001432761,0.0001420757,0.0002468512,0.00003370786,0.0004288264,0.00001200639],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002510042,"about_ca_system_score_gemma":0.00007993008,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_topic_score_codex":0.5752171,"about_ca_topic_score_gemma":0.8878438,"domain_scores_codex":[0.9983816,0.0002911928,0.0003633465,0.0003471889,0.00008280112,0.0005339449],"domain_scores_gemma":[0.9974093,0.001500058,0.000197517,0.0003696103,0.0001735417,0.0003499164],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"qualitative","study_design_scores_codex":[0.00001993231,0.00002675025,0.00194897,0.00179832,0.0000969566,0.006873634,0.6581163,0.00009303437,0.001102321,0.005204995,0.0007014,0.3240173],"study_design_scores_gemma":[0.001632989,0.001341862,0.005992812,0.04903917,0.0005704794,0.01430654,0.7962119,0.006370054,0.0001439024,0.0004933326,0.1217693,0.002127702],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9635813,0.02052483,0.00001724934,0.002856462,0.00004404804,0.00069749,0.0002300934,0.00004167193,0.01200692],"genre_scores_gemma":[0.9966228,0.0002052393,0.0006718441,0.001748838,0.0001610004,0.00005226917,0.00002092291,0.00005326985,0.0004637964],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.3218896,"threshold_uncertainty_score":0.7177471,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01766055693986884,"score_gpt":0.2359235001311821,"score_spread":0.2182629431913132,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}