{"id":"W2118347738","doi":"10.1176/appi.ajp.2012.12070999","title":"DSM-5 Field Trials in the United States and Canada, Part II: Test-Retest Reliability of Selected Categorical Diagnoses","year":2013,"lang":"en","type":"article","venue":"American Journal of Psychiatry","topic":"Personality Disorders and Psychopathology","field":"Psychology","cited_by":1156,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Medical diagnosis; Kappa; Intraclass correlation; Cohen's kappa; Medicine; Categorical variable; Clinical trial; Statistics; Psychometrics; Clinical psychology; Mathematics; Pathology","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1601967,0.002049987,0.003275728,0.001926465,0.005815613,0.002276999,0.002920953,0.002450999,0.001536196],"category_scores_gemma":[0.1715174,0.001935535,0.002334215,0.002472335,0.004936371,0.001290889,0.002568834,0.002441673,0.0005606907],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.01558023,"about_ca_system_score_gemma":0.02348057,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.2660078,"about_ca_topic_score_gemma":0.374382,"domain_scores_codex":[0.8075191,0.1540142,0.008226744,0.005280145,0.02283956,0.002120311],"domain_scores_gemma":[0.7988907,0.09286759,0.02694501,0.01141479,0.06454164,0.005340293],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.3037609,0.01154611,0.4029904,0.009973248,0.01762997,0.0002987033,0.01353777,0.007829053,0.002720878,0.007096226,0.04528059,0.1773361],"study_design_scores_gemma":[0.09607209,0.05513826,0.8012375,0.002763263,0.004541824,0.0002849881,0.002702799,0.006601719,0.002662537,0.002352469,0.02530145,0.000341181],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8227487,0.02537644,0.01422024,0.001791029,0.001686126,0.09969444,0.009651414,0.0002997885,0.02453197],"genre_scores_gemma":[0.890717,0.003585981,0.0240057,0.00125152,0.0003561733,0.06983354,0.007194692,0.0000833391,0.002972166],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.7339922,"threshold_uncertainty_score":0.8472111,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01380461564559386,"score_gpt":0.2951144389402294,"score_spread":0.2813098232946355,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}