{"id":"W117989676","doi":"10.1023/a:1009869328173","title":"Using Evidence to Improve Evaluation: A Comprehensive Psychometric Assessment of a SP-Based OSCE Licensing Examination","year":2000,"lang":"en","type":"article","venue":"Advances in Health Sciences Education","topic":"Innovations in Medical Education","field":"Medicine","cited_by":27,"is_retracted":false,"has_abstract":false,"ca_institutions":"Université de Sherbrooke; Université Laval","funders":"","keywords":"Generalizability theory; Objective structured clinical examination; Psychology; Reliability (semiconductor); Physical examination; Educational measurement; Psychometrics; Inter-rater reliability; Final examination; Clinical psychology; Medical education; Applied psychology; Medicine; Developmental psychology; Rating scale; Curriculum; Pedagogy","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2773131,0.001377262,0.003341269,0.008210982,0.00225078,0.004696551,0.002392624,0.002488951,0.001071165],"category_scores_gemma":[0.4529375,0.001037808,0.004573209,0.006286276,0.001693108,0.005866197,0.006496167,0.002429872,0.0002983419],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.004005441,"about_ca_system_score_gemma":0.0255227,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002161894,"about_ca_topic_score_gemma":0.007690664,"domain_scores_codex":[0.775893,0.111296,0.06262702,0.002924841,0.0457256,0.001533564],"domain_scores_gemma":[0.528978,0.294725,0.03350858,0.02543119,0.1133396,0.00401766],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.002006392,0.003565759,0.2195209,0.01418371,0.006337223,0.0003960062,0.007429342,0.001838532,0.003398782,0.002498154,0.003823433,0.7350019],"study_design_scores_gemma":[0.004969006,0.03132137,0.7518157,0.06190934,0.02473502,0.00206691,0.01987944,0.02213242,0.01704763,0.01086701,0.05214329,0.001112873],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8331789,0.02654365,0.06479051,0.01424914,0.0008795724,0.03937513,0.001250927,0.0002896051,0.01944257],"genre_scores_gemma":[0.7334567,0.007577009,0.2432581,0.001698759,0.0001743015,0.01190789,0.00134258,0.00007262415,0.0005119322],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.7226869,"threshold_uncertainty_score":0.8912016,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1175155964111513,"score_gpt":0.542076895844918,"score_spread":0.4245612994337667,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}