{"id":"W2072489006","doi":"10.1097/00001888-200510001-00017","title":"A Comparison of Physician Examiners and Trained Assessors in a High-Stakes OSCE Setting","year":2005,"lang":"en","type":"article","venue":"Academic Medicine","topic":"Innovations in Medical Education","field":"Medicine","cited_by":42,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Medical education; Educational measurement; Psychology; MEDLINE; Medicine; Family medicine; Curriculum; Pedagogy; Political science","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001061396,0.0001530124,0.0005623782,0.0003814721,0.00003199595,0.000001494865,0.0001050709,0.0002037722,0.00007205418],"category_scores_gemma":[0.002193894,0.0001246799,0.00001617288,0.0007671498,0.0003360692,0.0001012338,0.0000206049,0.0008629211,0.000003986942],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001103252,"about_ca_system_score_gemma":0.00009183268,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00007168541,"about_ca_topic_score_gemma":0.00000770482,"domain_scores_codex":[0.9981431,0.00005709671,0.0008329548,0.0002532476,0.0004557746,0.0002578217],"domain_scores_gemma":[0.9991116,0.0002260238,0.0002726273,0.0001971601,0.0001091485,0.00008345012],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.0001831443,0.0002780712,0.2558909,0.0007440294,0.00008871449,0.000009125886,0.06143896,0.00005286255,0.08850696,0.006307244,0.04179785,0.5447022],"study_design_scores_gemma":[0.01440024,0.001213236,0.8403949,0.00543775,0.000435375,0.00007511255,0.077236,0.02185491,0.01109598,0.0009734127,0.02631147,0.0005716414],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9662126,0.0006514521,0.0003947609,0.03040312,0.0001552999,0.0003129621,0.000001076308,0.00003581291,0.001832877],"genre_scores_gemma":[0.9917006,0.00008389848,0.002636528,0.004323423,0.0008381511,0.00002237008,0.00005181238,0.00001902303,0.0003241614],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.584504,"threshold_uncertainty_score":0.5084298,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04484784662818801,"score_gpt":0.4129022770139917,"score_spread":0.3680544303858037,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}