{"id":"W4411445833","doi":"10.7759/cureus.86366","title":"Adjusting for Resident Rater Leniency or Severity Improves the Reliability of Routine Resident Evaluations of Faculty Anesthesiologists","year":2025,"lang":"en","type":"article","venue":"Cureus","topic":"Radiology practices and education","field":"Medicine","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Medicine; Inter-rater reliability; Reliability (semiconductor); Family medicine; Physical therapy; Rating scale; Statistics","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1055449,0.0007468826,0.001285643,0.002168337,0.00118022,0.002089351,0.00139126,0.0008176106,0.001061209],"category_scores_gemma":[0.2856317,0.0006629997,0.001524246,0.002240934,0.001021813,0.001884195,0.002205118,0.00127159,0.0004455388],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001318947,"about_ca_system_score_gemma":0.001858576,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00559542,"about_ca_topic_score_gemma":0.008104663,"domain_scores_codex":[0.8746192,0.08681305,0.01317782,0.01108946,0.01233532,0.001965013],"domain_scores_gemma":[0.6465906,0.2038809,0.06594158,0.0419831,0.03873459,0.002869303],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0006831243,0.0002353583,0.9190327,0.0002635053,0.0008167137,0.00003837153,0.002284656,0.001186065,0.001005777,0.0001872039,0.001918126,0.07234841],"study_design_scores_gemma":[0.00006395883,0.0007683448,0.9898594,0.000119021,0.0003003836,0.000106905,0.0004316602,0.004552662,0.00172083,0.0003523981,0.001671726,0.0000527793],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9703973,0.0007790792,0.02270927,0.0007855585,0.0002337173,0.000518436,0.0004402249,0.0003170179,0.003819421],"genre_scores_gemma":[0.9910816,0.00008730977,0.007871321,0.0001055768,0.00008035242,0.0001895934,0.0002718036,0.00004844783,0.0002640279],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.8944551,"threshold_uncertainty_score":0.5581814,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0823975803660913,"score_gpt":0.437334998881693,"score_spread":0.3549374185156017,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}