{"id":"W2073773377","doi":"10.1007/s10459-008-9120-8","title":"Script concordance testing: more cases or more questions?","year":2008,"lang":"en","type":"article","venue":"Advances in Health Sciences Education","topic":"Clinical Reasoning and Diagnostic Skills","field":"Medicine","cited_by":66,"is_retracted":false,"has_abstract":false,"ca_institutions":"Université de Montréal","funders":"","keywords":"Concordance; Reliability (semiconductor); Variance (accounting); Nested set model; Statistics; Variance components; Test (biology); Computer science; Mathematics; Medicine; Data mining; Internal medicine","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.000594491,0.0001171337,0.0002640548,0.000148034,0.0003534445,0.00001326115,0.0001294073,0.00004150812,0.00003655527],"category_scores_gemma":[0.0612284,0.00008804929,0.00002637602,0.001217259,0.0007810014,0.0003248256,0.00001812672,0.0001730363,0.00001612934],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001736013,"about_ca_system_score_gemma":0.00430003,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001992461,"about_ca_topic_score_gemma":0.0002060785,"domain_scores_codex":[0.9983318,0.00005687336,0.0005128377,0.0004048329,0.0003451075,0.0003485618],"domain_scores_gemma":[0.9926722,0.006371744,0.0002399783,0.0002348912,0.0001890738,0.0002921139],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00005788139,0.0005367247,0.8698336,0.0001258407,0.000001163384,0.00003431254,0.0008254761,0.000435483,0.000004879251,0.0006628986,0.002731446,0.1247503],"study_design_scores_gemma":[0.0008324164,0.002024151,0.9505214,0.007749124,0.00001061115,0.001829464,0.003401953,0.001728214,0.00005406358,0.001218393,0.03035212,0.0002780979],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9566485,0.02235373,0.0001478815,0.01608526,0.00179382,0.0006055338,0.000004986657,0.00009867107,0.002261596],"genre_scores_gemma":[0.9536589,0.006691803,0.03070287,0.00765436,0.0003101645,0.000102408,0.0000132057,0.000008365758,0.0008579015],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1244722,"threshold_uncertainty_score":0.9466793,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0905657237337662,"score_gpt":0.4756656871024329,"score_spread":0.3850999633686667,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}