{"id":"W2965327127","doi":"10.1093/jamia/ocz112","title":"Development of a global infectious disease activity database using natural language processing, machine learning, and human expertise","year":2019,"lang":"en","type":"article","venue":"Journal of the American Medical Informatics Association","topic":"Data-Driven Disease Surveillance","field":"Medicine","cited_by":31,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto; BlueDot (Canada); St. Michael's Hospital","funders":"","keywords":"Computer science; Machine learning; Artificial intelligence; Infectious disease (medical specialty); Representativeness heuristic; Classifier (UML); Information extraction; Natural language processing; Disease; Medicine; Pathology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0007984001,0.0001037674,0.0003774023,0.00005066556,0.00008171998,0.00002230341,0.0001273375,0.00003108197,0.00002338456],"category_scores_gemma":[0.001491229,0.0000689091,0.00008436564,0.000244489,0.00008442702,0.0002553403,0.0001362876,0.000373619,0.000001859835],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006133889,"about_ca_system_score_gemma":0.000629389,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00005775797,"about_ca_topic_score_gemma":0.00003020562,"domain_scores_codex":[0.9980243,0.0001021277,0.0005653689,0.0000544248,0.001101311,0.0001524382],"domain_scores_gemma":[0.9971372,0.00005150506,0.002258097,0.0001212551,0.0001910492,0.0002408571],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0002246384,0.0001849843,0.9487114,0.0002786255,0.0001584319,0.000009283007,0.001363168,0.00001519468,0.001877646,0.000003482216,0.0001256769,0.0470475],"study_design_scores_gemma":[0.00283244,0.000220275,0.9203701,0.0009306316,0.0002329775,0.00009587555,0.001065186,0.07266411,0.0002709321,0.000005371745,0.001114471,0.0001976286],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9988818,0.0002226238,0.0004081549,0.0001513708,0.00009499677,0.0001300054,0.00002389711,0.0000130026,0.00007417438],"genre_scores_gemma":[0.9978566,0.00002221843,0.001723818,0.0002902603,0.00005278751,8.219181e-7,0.00001682863,0.000006699973,0.00003001423],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.07264891,"threshold_uncertainty_score":0.2810031,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.00696299589376862,"score_gpt":0.3142278333592521,"score_spread":0.3072648374654834,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}