{"id":"W3157388129","doi":"10.1016/j.jss.2021.03.057","title":"The Impact of Surgeon Experience on Script Concordance Test Scoring","year":2021,"lang":"en","type":"article","venue":"Journal of Surgical Research","topic":"Clinical Reasoning and Diagnostic Skills","field":"Medicine","cited_by":1,"is_retracted":false,"has_abstract":false,"ca_institutions":"University of Ottawa","funders":"University of Ottawa","keywords":"Concordance; Medicine; Test (biology); Specialty; Subgroup analysis; Family medicine; Meta-analysis; Internal medicine","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.003758039,0.00008618001,0.0004166556,0.00009195154,0.0001288737,0.00004932199,0.0001922079,0.00006916448,0.0002587737],"category_scores_gemma":[0.1811849,0.00004450643,0.0003666772,0.0005849476,0.0004051249,0.00005092243,0.00008007271,0.00100918,0.00001726693],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001369166,"about_ca_system_score_gemma":0.001057323,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00008474499,"about_ca_topic_score_gemma":0.000002947691,"domain_scores_codex":[0.9971098,0.0002579504,0.0006385685,0.0001489022,0.001442617,0.0004022121],"domain_scores_gemma":[0.9047467,0.09197557,0.0002210162,0.0003737421,0.002135759,0.0005472858],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.005035983,0.002755072,0.8305382,0.00004520161,0.0002132749,0.0151002,0.0004531067,0.0000979305,0.01227741,0.00127623,0.02161104,0.1105963],"study_design_scores_gemma":[0.00818561,0.01147542,0.8854755,0.01315145,0.00004866022,0.004153841,0.002466838,0.0004079991,0.05293246,0.001509992,0.01994075,0.0002514576],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9902497,0.002054071,0.00000473779,0.002465773,0.0001797576,0.00006744565,0.000002703085,0.000003331647,0.004972458],"genre_scores_gemma":[0.9938807,0.004643085,0.0000471212,0.00002459583,0.0003317088,0.000002307144,6.362259e-7,0.000009504435,0.001060319],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1774268,"threshold_uncertainty_score":0.8257123,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1482298942759711,"score_gpt":0.5095313188142345,"score_spread":0.3613014245382634,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}