{"id":"W3135680700","doi":"10.1371/journal.pone.0247872","title":"Cohort profile: St. Michael’s Hospital Tuberculosis Database (SMH-TB), a retrospective cohort of electronic health record data and variables extracted using natural language processing","year":2021,"lang":"en","type":"article","venue":"PLoS ONE","topic":"Tuberculosis Research and Epidemiology","field":"Medicine","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"Vector Institute; Toronto Metropolitan University; University of Toronto; St. Michael's Hospital","funders":"Government of Ontario","keywords":"Medicine; Retrospective cohort study; Electronic health record; Cohort; Tuberculosis; Dictation; Population; Medical record; Confidence interval; Generalizability theory; Database; Pediatrics; Artificial intelligence; Natural language processing; Internal medicine; Health care; Statistics; Computer science; Pathology; Speech recognition","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003347799,0.0005332335,0.0005751345,0.002657799,0.001130485,0.001313172,0.001218815,0.0005550393,0.008164998],"category_scores_gemma":[0.01788468,0.0003560705,0.0007054119,0.004833344,0.0002714485,0.000624232,0.001031405,0.0005981047,0.002872807],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002579314,"about_ca_system_score_gemma":0.008094901,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.2356006,"about_ca_topic_score_gemma":0.2884002,"domain_scores_codex":[0.9977088,0.000278721,0.000472259,0.0006408698,0.0006932759,0.0002059659],"domain_scores_gemma":[0.9844145,0.001681771,0.002624112,0.003453896,0.006451407,0.001374398],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0009846068,0.0001335727,0.8453716,0.0005728064,0.0003619407,0.0003802242,0.0004388309,0.0005130646,0.001168228,0.0008134965,0.1351462,0.01411529],"study_design_scores_gemma":[0.000303143,0.0001819145,0.9113321,0.0004269987,0.0002711909,0.0009237449,0.0006387291,0.001778506,0.001362386,0.0004232685,0.08226851,0.00008959597],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"dataset","genre_gemma":"empirical","genre_scores_codex":[0.1002411,0.0002535465,0.002087273,0.0005696816,0.0000695013,0.001254397,0.8926163,0.0002484508,0.00265974],"genre_scores_gemma":[0.1667682,0.00033434,0.006634833,0.0005804902,0.00009332312,0.002573899,0.8203865,0.0001186216,0.002509892],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.2356006,"threshold_uncertainty_score":0.4684584,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03587104851095937,"score_gpt":0.3252136872303806,"score_spread":0.2893426387194212,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}