{"id":"W2805299437","doi":"10.3389/feduc.2018.00042","title":"Examining Score Report Language in Accountability Testing","year":2018,"lang":"en","type":"article","venue":"Frontiers in Education","topic":"Management and Organizational Studies","field":"Business, Management and Accounting","cited_by":8,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Accountability; Context (archaeology); Conversation analysis; Conversation; Discourse analysis; Interpretation (philosophy); Sample (material); Situated; Empirical research; Language assessment; Psychology; Linguistics; Political science; Computer science; Pedagogy; Epistemology; Artificial intelligence","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0004797356,0.00009664398,0.000117775,0.0003446975,0.00009676697,0.00009350995,0.00013015,0.00003392949,0.0001190433],"category_scores_gemma":[0.0007992679,0.0001015965,0.00001041294,0.001102819,0.00005256023,0.0006796996,0.00009837302,0.00006907844,0.00004049509],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001195087,"about_ca_system_score_gemma":0.00004318274,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001289598,"about_ca_topic_score_gemma":0.0007023503,"domain_scores_codex":[0.9991679,0.000007172032,0.0002559805,0.0002560412,0.0001443037,0.0001685952],"domain_scores_gemma":[0.9995325,0.00001813904,0.0001396796,0.0001651509,0.0001397083,0.000004801277],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.000004770283,0.00007197017,0.9626195,0.00005014567,0.000003165003,0.00000310875,0.0003416495,0.0000048778,0.00002126841,0.000342102,0.01863569,0.01790168],"study_design_scores_gemma":[0.0001311291,0.000003348795,0.978906,0.00006877752,0.000008128054,8.092448e-7,0.006518748,0.0005618372,0.00001231578,0.003063894,0.01059693,0.0001280714],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9263655,0.0002358192,0.0007562017,0.0002153762,0.002341465,0.0002295234,2.161049e-7,0.0000582631,0.06979764],"genre_scores_gemma":[0.9915102,0.000003165281,0.005695032,0.0005871035,0.001541235,0.00002807036,0.00004269528,0.00001400557,0.0005785438],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.06921909,"threshold_uncertainty_score":0.4142986,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02881192560449489,"score_gpt":0.2610577279211443,"score_spread":0.2322458023166495,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}