{"id":"W2034878828","doi":"10.1111/j.1745-3992.2002.tb00087.x","title":"Scoring Examinee Responses for Multiple Inferences: Multiple Scoring in Assessments","year":2002,"lang":"en","type":"article","venue":"Educational Measurement Issues and Practice","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Scoring system; Inference; Scale (ratio); Computer science; Psychology; Artificial intelligence; Medicine; Geography","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.2417733,0.001823998,0.00271525,0.008021637,0.003583667,0.006277646,0.004437303,0.003681848,0.003011699],"category_scores_gemma":[0.6199554,0.001485733,0.001669702,0.009639783,0.005026605,0.008386918,0.009490683,0.005786226,0.0017098],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00234414,"about_ca_system_score_gemma":0.005235274,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00202344,"about_ca_topic_score_gemma":0.004366837,"domain_scores_codex":[0.4610018,0.4184369,0.03350605,0.01260563,0.0722926,0.002156997],"domain_scores_gemma":[0.3675581,0.4660519,0.04549431,0.05264957,0.06584612,0.002399975],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0006182455,0.0005661629,0.05209879,0.003940347,0.001112608,0.0007368368,0.02457538,0.001912921,0.00455642,0.05679538,0.02009414,0.8329927],"study_design_scores_gemma":[0.0008950499,0.002880175,0.208109,0.01493108,0.002333569,0.009783708,0.02252549,0.068446,0.05486838,0.4212022,0.1920457,0.001979696],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0377364,0.003521816,0.9341734,0.004891808,0.001254472,0.003304689,0.0002142485,0.001044,0.0138592],"genre_scores_gemma":[0.2196508,0.002432112,0.7662473,0.002255481,0.0007000656,0.005131784,0.0002537149,0.0003984318,0.002930346],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.2417733,"threshold_uncertainty_score":0.9350285,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.8659566286900213,"score_gpt":0.5782094015970195,"score_spread":0.2877472270930018,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}