{"id":"W1988426064","doi":"10.1097/00001888-200207000-00018","title":"The Effect of Candidatesʼ Perceptions of the Evaluation Method on Reliability of Checklist and Global Rating Scores in an Objective Structured Clinical Examination","year":2002,"lang":"en","type":"article","venue":"Academic Medicine","topic":"Innovations in Medical Education","field":"Medicine","cited_by":29,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Checklist; Competence (human resources); Psychology; Reliability (semiconductor); Inter-rater reliability; Objective structured clinical examination; Clinical psychology; Rating scale; Social psychology; Developmental psychology; Psychiatry","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.02251602,0.0004140003,0.0003406801,0.0006023418,0.000443188,0.001275998,0.0003729606,0.0005186153,0.003012575],"category_scores_gemma":[0.113633,0.0003253961,0.0005630737,0.0003474511,0.0008565134,0.0006360085,0.0008826576,0.0006566776,0.0006507188],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004299972,"about_ca_system_score_gemma":0.0005113332,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0004318593,"about_ca_topic_score_gemma":0.0008816486,"domain_scores_codex":[0.9695999,0.02019032,0.002209303,0.001636953,0.005548267,0.0008152804],"domain_scores_gemma":[0.8146445,0.1519907,0.01680441,0.004732425,0.006462237,0.005365725],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.01351939,0.001664065,0.8910984,0.0002198333,0.0004306026,0.0002651642,0.005167928,0.0006472182,0.01069317,0.0001310586,0.0007601653,0.07540299],"study_design_scores_gemma":[0.0001272306,0.009299033,0.9845188,0.00004555041,0.0001065608,0.0002543759,0.001619226,0.001146711,0.002292421,0.00004837453,0.0005040535,0.00003760929],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9984083,0.00009840847,0.0005329054,0.00005937312,0.00001877976,0.00003611111,0.0000105344,0.00001180078,0.0008238949],"genre_scores_gemma":[0.9989016,0.00003778134,0.0006435032,0.00002792356,0.0000136068,0.00003613502,0.00003010043,0.00001037316,0.0002990094],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.977484,"threshold_uncertainty_score":0.1190775,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04147012368778285,"score_gpt":0.4665947897673515,"score_spread":0.4251246660795686,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}