{"id":"W2917561174","doi":"10.1111/medu.13814","title":"Experts’ responses in script concordance tests: a response process validity investigation","year":2019,"lang":"en","type":"article","venue":"Medical Education","topic":"Clinical Reasoning and Diagnostic Skills","field":"Medicine","cited_by":26,"is_retracted":false,"has_abstract":true,"ca_institutions":"College of Family Physicians of Canada","funders":"","keywords":"Concordance; Context (archaeology); Consistency (knowledge bases); Test (biology); Psychology; Process (computing); Action (physics); Qualitative property; Applied psychology; Medicine; Social psychology; Computer science; Artificial intelligence; Machine learning","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.3777463,0.0009236909,0.001530058,0.004808248,0.003537206,0.003703917,0.003099309,0.002377822,0.002312503],"category_scores_gemma":[0.674965,0.0008688018,0.00201695,0.00413589,0.006152493,0.003864795,0.01002676,0.002590908,0.000615804],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.005753718,"about_ca_system_score_gemma":0.006734759,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002254457,"about_ca_topic_score_gemma":0.002377273,"domain_scores_codex":[0.35807,0.528595,0.04209594,0.01605924,0.05008281,0.005096909],"domain_scores_gemma":[0.1836773,0.6564956,0.05843069,0.0348643,0.0641007,0.002431482],"domain_codex":"methods","domain_gemma":"methods","domain_candidate":"methods","domain_consensus":"methods","study_design_codex":"qualitative","study_design_gemma":"observational","study_design_scores_codex":[0.003886853,0.001041548,0.238283,0.003264008,0.0006515781,0.001046022,0.6118492,0.003113521,0.006100433,0.006552419,0.002812261,0.1213991],"study_design_scores_gemma":[0.001636418,0.008649202,0.4390233,0.007218992,0.0008012129,0.003240504,0.3455259,0.07383431,0.04122432,0.02862044,0.0489865,0.001238958],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9362822,0.0004090245,0.04988377,0.001038,0.0002219421,0.006033465,0.0002709689,0.0001216235,0.005739096],"genre_scores_gemma":[0.9644264,0.000108879,0.02350212,0.0006486969,0.00008047623,0.01043234,0.0002460483,0.0001075169,0.0004475263],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.6222537,"threshold_uncertainty_score":0.7673496,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04101367176045202,"score_gpt":0.402577520766441,"score_spread":0.361563849005989,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}