{"id":"W2120950549","doi":"10.1097/00001888-200410001-00002","title":"An Examination of the Appropriateness of Using a Common Peer Assessment Instrument to Assess Physician Skills across Specialties","year":2004,"lang":"en","type":"article","venue":"Academic Medicine","topic":"Innovations in Medical Education","field":"Medicine","cited_by":41,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Calgary","funders":"","keywords":"Cronbach's alpha; Generalizability theory; Specialty; Medicine; Reliability (semiconductor); Family medicine; Psychometrics; Psychology; Clinical psychology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002184029,0.0001712385,0.0005003056,0.0001759164,0.0001082596,0.000003707402,0.0003374127,0.0002008267,0.00003118634],"category_scores_gemma":[0.00079316,0.0001144183,0.00004068476,0.001086609,0.0004262225,0.0001443407,0.00008224514,0.0006108016,0.000001357874],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004699696,"about_ca_system_score_gemma":0.0003424117,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001949228,"about_ca_topic_score_gemma":0.000006729911,"domain_scores_codex":[0.9970701,0.0001163513,0.0008604247,0.0002536942,0.001442214,0.0002571908],"domain_scores_gemma":[0.9981039,0.00005737616,0.0004901602,0.0005388837,0.0007194698,0.00009018802],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"bench_or_experimental","study_design_gemma":"observational","study_design_scores_codex":[0.0001426661,0.001227442,0.08777796,0.001185093,0.0002111201,0.00000474124,0.09430316,0.001949204,0.5193574,0.02705433,0.0008739827,0.2659129],"study_design_scores_gemma":[0.003305955,0.0006317271,0.8720818,0.002853688,0.0002194597,0.00002694979,0.02815567,0.0007525089,0.08900785,0.002023677,0.0007374226,0.0002033683],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9851853,0.00002450054,0.005950474,0.006485194,0.0009128968,0.0007934616,0.000006203924,0.00001993828,0.0006220768],"genre_scores_gemma":[0.9935198,0.00001583506,0.00318875,0.002222033,0.0008486693,0.00002864799,0.00005236652,0.00002316355,0.000100742],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.7843038,"threshold_uncertainty_score":0.4665842,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06326721913361225,"score_gpt":0.4338719509033059,"score_spread":0.3706047317696937,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}