{"id":"W2905051589","doi":"10.1177/0734282918816849","title":"Examining the Reliability of Scores From a Performance Assessment of Practice-Based Competencies","year":2018,"lang":"en","type":"article","venue":"Journal of Psychoeducational Assessment","topic":"Innovations in Medical Education","field":"Medicine","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Medical Council of Canada; University of Alberta","funders":"","keywords":"Generalizability theory; Psychology; Reliability (semiconductor); Variance (accounting); Variation (astronomy); Variance components; Explained variation; Clinical psychology; Statistics; Applied psychology; Developmental psychology; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002619999,0.0001169894,0.000323487,0.0002093269,0.0001016971,0.00001428898,0.0002573681,0.00005740569,0.0005346956],"category_scores_gemma":[0.001300601,0.00007646569,0.00008940961,0.0005043582,0.0004559287,0.0002318114,0.00002156715,0.0004209136,0.00000201264],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003202207,"about_ca_system_score_gemma":0.003687507,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00003930463,"about_ca_topic_score_gemma":0.000001478438,"domain_scores_codex":[0.9971386,0.0001599876,0.001165806,0.0001498012,0.001258325,0.0001275106],"domain_scores_gemma":[0.9930416,0.0008083118,0.001691932,0.0004189935,0.003981269,0.00005789318],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0004158695,0.00539431,0.9417357,0.0002560165,0.0003733423,0.000001385622,0.001910978,0.000339201,0.01135215,0.003943352,0.01664024,0.0176374],"study_design_scores_gemma":[0.0008882739,0.001244547,0.9855636,0.000524722,0.0001783296,0.00002935199,0.002989915,0.002344985,0.001192605,0.0004326642,0.004545303,0.00006573369],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.970337,0.00006241976,0.006477818,0.01806289,0.001530702,0.0002377344,0.000006647494,0.000004016224,0.003280778],"genre_scores_gemma":[0.7696961,0.00002391673,0.2286395,0.0008872048,0.000685376,0.0000137953,0.00001733955,0.000008067003,0.0000286896],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.2221617,"threshold_uncertainty_score":0.6541478,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04365185737418878,"score_gpt":0.4278329816498999,"score_spread":0.3841811242757111,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}