{"id":"W2133299511","doi":"10.1007/s10459-007-9063-5","title":"Are specialist certification examinations a reliable measure of physician competence?","year":2007,"lang":"en","type":"article","venue":"Advances in Health Sciences Education","topic":"Innovations in Medical Education","field":"Medicine","cited_by":19,"is_retracted":false,"has_abstract":false,"ca_institutions":"McMaster University","funders":"","keywords":"Generalizability theory; Certification; Competence (human resources); Credibility; Inter-rater reliability; Objective structured clinical examination; Reliability (semiconductor); Medicine; Medical education; Physical examination; Nursing; Family medicine; Psychology; Rating scale; Social psychology; Surgery","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.03023555,0.0005736661,0.001510374,0.003190188,0.0005963112,0.002200794,0.002064289,0.004103186,0.00342505],"category_scores_gemma":[0.2849175,0.000740149,0.000965807,0.002464818,0.002423744,0.004084259,0.001211566,0.001532397,0.001832072],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001015783,"about_ca_system_score_gemma":0.001882863,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004715611,"about_ca_topic_score_gemma":0.007288195,"domain_scores_codex":[0.9767519,0.008547347,0.003998124,0.002448077,0.006931308,0.001323218],"domain_scores_gemma":[0.6932966,0.1553681,0.05736525,0.02297338,0.06598215,0.005014568],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0001840243,0.0001536347,0.9661936,0.0002002226,0.0002019663,0.00007087317,0.0002501903,0.0002306417,0.000377363,0.0005387529,0.004510807,0.02708793],"study_design_scores_gemma":[0.00005387559,0.0003331504,0.9892904,0.0003004486,0.0001612852,0.0006386361,0.0003811695,0.002231335,0.001003093,0.001006743,0.004566614,0.00003323442],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9360464,0.01044286,0.0101501,0.01653385,0.001374254,0.0001377912,0.003231898,0.0001803893,0.02190238],"genre_scores_gemma":[0.9912149,0.001083063,0.003449514,0.00144113,0.0007181311,0.00007613473,0.001173599,0.00003550257,0.0008079372],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9697645,"threshold_uncertainty_score":0.1599028,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0394656992417157,"score_gpt":0.4117766294935065,"score_spread":0.3723109302517907,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}