{"id":"W2791245005","doi":"10.5430/wje.v8n1p111","title":"Effects of Analytical and Holistic Scoring Patterns on Scorer Reliability in Biology Essay Tests","year":2018,"lang":"en","type":"article","venue":"World Journal of Education","topic":"Digital Imaging for Blood Diseases","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Pearson product-moment correlation coefficient; Reliability (semiconductor); Test (biology); Data collection; Moment (physics); Scoring system; Mathematics education; Biology; Psychology; Statistics; Medicine; Mathematics; Internal medicine; Ecology","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.000245188,0.00006483048,0.0001390777,0.0003467528,0.00001662616,0.00004935771,0.0002214853,0.0000133329,0.000002645788],"category_scores_gemma":[0.0007412354,0.0000542319,0.00003108162,0.000305823,0.00009977684,0.0003421827,0.00005106863,0.00008432881,0.00000248074],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00006486686,"about_ca_system_score_gemma":0.0002252525,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00002638663,"about_ca_topic_score_gemma":0.00001508795,"domain_scores_codex":[0.9993328,0.00005815209,0.0002582407,0.0001349337,0.0001072111,0.0001086194],"domain_scores_gemma":[0.999088,0.000318284,0.000175051,0.0001685756,0.0001646472,0.00008542276],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00002869947,0.0009835677,0.9233327,0.000109166,0.0000109677,0.000004974524,0.0003113495,0.0000120853,0.0004484495,0.01634715,0.0002674771,0.05814344],"study_design_scores_gemma":[0.000237954,0.0002539444,0.981092,0.0004562683,0.00001535786,0.00001218657,0.000009845619,0.0004597617,0.001827435,0.01548034,0.00009168243,0.00006316855],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9959482,0.0001415154,0.002031459,0.0004262656,0.0006561073,0.00005852554,5.621262e-7,0.000004983311,0.0007323844],"genre_scores_gemma":[0.9980897,0.000004227771,0.001597736,0.0001314288,0.0001283181,0.000001360635,3.12334e-7,0.00000323638,0.00004366098],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.05808027,"threshold_uncertainty_score":0.2211513,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01652793913598873,"score_gpt":0.3327994318309083,"score_spread":0.3162714926949196,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}