{"id":"W1980392619","doi":"10.1007/s40037-012-0017-0","title":"Effects of two different instructional formats on scores and reliability of a script concordance test","year":2012,"lang":"en","type":"article","venue":"Perspectives on Medical Education","topic":"Clinical Reasoning and Diagnostic Skills","field":"Medicine","cited_by":12,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"University of Adelaide; Universitair Medisch Centrum Utrecht; Universiteit Utrecht; McGill University","keywords":"Concordance; Test (biology); Reliability (semiconductor); Computer science; Medical education; Psychology; Medical physics; Natural language processing; Medicine; Internal medicine","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.0002768392,0.0001009122,0.0002811738,0.00007119364,0.00002722591,0.000002714751,0.00004476422,0.00007188132,0.00009279529],"category_scores_gemma":[0.1225068,0.00007150479,0.00005957167,0.00009595865,0.0003814421,0.00004820203,0.00001795281,0.0002190517,0.000004153092],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00009932859,"about_ca_system_score_gemma":0.0003177257,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00008537713,"about_ca_topic_score_gemma":0.000001637909,"domain_scores_codex":[0.998875,0.00005642635,0.0002684702,0.0001798887,0.0004842385,0.0001360145],"domain_scores_gemma":[0.9913607,0.007814676,0.0001323404,0.0001694161,0.0001701955,0.0003527358],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0006096667,0.01426483,0.890487,0.0004687505,0.00003982297,8.898162e-7,0.005342027,9.937858e-7,0.000729604,0.02492734,0.001083047,0.06204608],"study_design_scores_gemma":[0.001557538,0.0009497331,0.9886953,0.002403345,0.00005796305,0.00001366368,0.001070224,0.00006101545,0.003975295,0.001113775,0.00003904256,0.00006309802],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9959408,0.0007631792,0.00006995748,0.001576383,0.0005147089,0.0002621752,0.000003834867,0.00001418388,0.0008548002],"genre_scores_gemma":[0.9983777,0.0003205638,0.0004935506,0.0003879766,0.0003370149,0.00003171209,0.000007700201,0.000006924357,0.00003687484],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.12223,"threshold_uncertainty_score":0.8848847,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01008520355608489,"score_gpt":0.3485447254425015,"score_spread":0.3384595218864166,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}