{"id":"W4386496107","doi":"10.2196/42477","title":"Applying Natural Language Processing to Textual Data From Clinical Data Warehouses: Systematic Review","year":2023,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Machine Learning in Healthcare","field":"Computer Science","cited_by":21,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Agence Nationale de la Recherche","keywords":"Computer science; Unstructured data; Natural language processing; Information retrieval; Artificial intelligence; Data extraction; Information extraction; Named-entity recognition; Systematic review; Big data; MEDLINE; Data science; Task (project management); Data mining","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03087937,0.00216128,0.009495382,0.02238281,0.00112316,0.00433926,0.003760909,0.002563642,0.005152068],"category_scores_gemma":[0.1451177,0.001645197,0.01195081,0.02218031,0.00208038,0.006112428,0.002683653,0.001873401,0.0006468025],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.005210304,"about_ca_system_score_gemma":0.02256458,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007392919,"about_ca_topic_score_gemma":0.01937429,"domain_scores_codex":[0.9677913,0.01480689,0.01090716,0.001833985,0.004246956,0.0004135981],"domain_scores_gemma":[0.7889694,0.1758411,0.02076042,0.002919478,0.01094551,0.0005641871],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"systematic_review","study_design_gemma":"systematic_review","study_design_scores_codex":[0.0001069385,0.00002509227,0.0004763682,0.9557151,0.006639762,0.00007766714,0.0002318987,0.000122017,0.00009829167,0.0002040222,0.000968818,0.03533394],"study_design_scores_gemma":[0.0002440464,0.0002594512,0.002297484,0.9228331,0.05273734,0.0002899496,0.0006030364,0.0002422019,0.0003519909,0.0006442351,0.01942674,0.00007031739],"study_design_candidate":"systematic_review","study_design_consensus":"systematic_review","genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.00103074,0.9954489,0.0009240005,0.0004584473,0.0001457209,0.001114903,0.0004868929,0.00002490854,0.0003655144],"genre_scores_gemma":[0.01382576,0.9772077,0.004371401,0.0009660341,0.0001474255,0.002821844,0.0005222662,0.00001770624,0.0001198392],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.03087937,"threshold_uncertainty_score":0.1633076,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1218366320840245,"score_gpt":0.4661288339060583,"score_spread":0.3442922018220338,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}