{"id":"W4386055806","doi":"10.4103/singaporemedj.smj-2021-230","title":"Modified endocrinology script concordance test: evaluating the reliability and construct validity for assessing clinical reasoning","year":2023,"lang":"en","type":"article","venue":"Singapore Medical Journal","topic":"Clinical Reasoning and Diagnostic Skills","field":"Medicine","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Concordance; Medicine; Construct validity; Test (biology); Reliability (semiconductor); Construct (python library); Validity; Psychometrics; Clinical psychology; Medical physics; Internal medicine","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.01595275,0.0002326826,0.0007932613,0.00007941099,0.00073083,0.000148217,0.0002505741,0.0003129355,0.00009883958],"category_scores_gemma":[0.6471915,0.0001440925,0.0003183037,0.0003089831,0.001535316,0.00009797614,0.0001720435,0.002008206,0.00001113435],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000078204,"about_ca_system_score_gemma":0.001494755,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00001916354,"about_ca_topic_score_gemma":0.000002868244,"domain_scores_codex":[0.9954466,0.0007594746,0.001430209,0.0005361451,0.001088933,0.0007386009],"domain_scores_gemma":[0.8753927,0.1213394,0.0007190472,0.0005626336,0.0007150221,0.001271232],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0003762743,0.0002522405,0.5101995,0.00007036572,0.00009776429,0.0005899791,0.0001568276,0.00003103044,0.0001133624,0.0006967377,0.009590926,0.477825],"study_design_scores_gemma":[0.01495012,0.003915953,0.7332088,0.007778825,0.0009813644,0.01410725,0.001369003,0.1947941,0.0001199026,0.02499216,0.003225539,0.0005569239],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9737494,0.0003473861,0.003590141,0.01897353,0.002105833,0.0004193558,0.00001053719,0.0001383751,0.0006654583],"genre_scores_gemma":[0.9870136,0.000561983,0.007628503,0.002398282,0.002175095,0.00002345169,0.00002095885,0.00003241753,0.0001456908],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.6312388,"threshold_uncertainty_score":0.8724766,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.169087077322201,"score_gpt":0.4818171796026054,"score_spread":0.3127301022804044,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}