{"id":"W1980392619","doi":"10.1007/s40037-012-0017-0","title":"Effects of two different instructional formats on scores and reliability of a script concordance test","year":2012,"lang":"en","type":"article","venue":"Perspectives on Medical Education","topic":"Clinical Reasoning and Diagnostic Skills","field":"Medicine","cited_by":12,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"University of Adelaide; Universitair Medisch Centrum Utrecht; Universiteit Utrecht; McGill University","keywords":"Concordance; Test (biology); Reliability (semiconductor); Computer science; Medical education; Psychology; Medical physics; Natural language processing; Medicine; Internal medicine","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.07840686,0.001656014,0.00187262,0.002398305,0.0006878806,0.002026083,0.001546498,0.001786162,0.002276017],"category_scores_gemma":[0.4540674,0.001358728,0.001661273,0.001782956,0.001947637,0.002455647,0.002716937,0.002277635,0.0006432383],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001529383,"about_ca_system_score_gemma":0.001270033,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0008989396,"about_ca_topic_score_gemma":0.001330713,"domain_scores_codex":[0.8625759,0.08602321,0.01618754,0.007645081,0.02529084,0.002277363],"domain_scores_gemma":[0.2460785,0.6822887,0.02471456,0.01651146,0.02509478,0.005311985],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.1079312,0.02205105,0.4876639,0.001071192,0.002655568,0.0006193266,0.02158665,0.007262016,0.01910339,0.0009222212,0.002519743,0.3266138],"study_design_scores_gemma":[0.004603056,0.08351278,0.8576971,0.0003920596,0.00173539,0.0005716308,0.002400634,0.01921576,0.02597666,0.0009883398,0.00244633,0.0004602975],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9944744,0.0001571605,0.002706679,0.0001012561,0.0001764119,0.0005763751,0.00008558378,0.0001602115,0.001562073],"genre_scores_gemma":[0.9872061,0.0001116798,0.009652069,0.0001521863,0.0001226963,0.001405728,0.0004162959,0.0001308923,0.0008023995],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.07840686,"threshold_uncertainty_score":0.4146601,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01008520355608489,"score_gpt":0.3485447254425015,"score_spread":0.3384595218864166,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}