{"id":"W4320302550","doi":"10.53841/bpsadm.2018.10.2.22","title":"Assessment in the digital age: Some challenges for Test Developers and Users","year":2018,"lang":"en","type":"article","venue":"Assessment and Development Matters","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"ASTER","funders":"","keywords":"Key (lock); Test (biology); Psychometrics; Computer science; Data science; Psychometric testing; Engineering ethics; Psychology; Applied psychology; Engineering; Clinical psychology; Computer security","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0052601,0.0002170599,0.0003119788,0.0003933411,0.0003371337,0.0008790784,0.0004977121,0.00006139083,0.00002297104],"category_scores_gemma":[0.00225524,0.0001317231,0.00003118406,0.0004704416,0.0002085361,0.0004275743,0.0002238213,0.0001441508,0.000009492634],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00006857992,"about_ca_system_score_gemma":0.0001713064,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000005532599,"about_ca_topic_score_gemma":0.00002181819,"domain_scores_codex":[0.9975328,0.0001357274,0.0005888336,0.0005986498,0.0007368483,0.0004071476],"domain_scores_gemma":[0.986307,0.01303752,0.0001899218,0.0002824118,0.00009316641,0.00008996457],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00001203541,0.0000942168,0.5321596,0.0000272173,0.00003502521,0.00001267102,0.002720946,9.021695e-7,0.00007138764,0.003012895,0.005790448,0.4560626],"study_design_scores_gemma":[0.0005891374,0.0001285629,0.9171428,0.00002654725,0.000004495883,0.00001040644,0.00819094,0.0000905786,0.00001402093,0.005324342,0.06826164,0.0002165077],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9412631,0.0004869042,0.0135035,0.02860094,0.0008040847,0.001126078,0.00001337775,0.00007575388,0.01412622],"genre_scores_gemma":[0.8879893,0.0001414883,0.1088866,0.002627225,0.00007022319,0.00009591431,0.000006625518,0.000012269,0.0001702596],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.4558461,"threshold_uncertainty_score":0.8476973,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.4041266623758634,"score_gpt":0.4711374105617989,"score_spread":0.06701074818593555,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}