{"id":"W3010725448","doi":"10.1186/s12911-020-1068-5","title":"Methods to improve the quality of smoking records in a primary care EMR database: exploring multiple imputation and pattern-matching algorithms","year":2020,"lang":"en","type":"article","venue":"BMC Medical Informatics and Decision Making","topic":"Data-Driven Disease Surveillance","field":"Medicine","cited_by":17,"is_retracted":false,"has_abstract":true,"ca_institutions":"Health Sciences Centre; University of Alberta; University of Calgary","funders":"Canadian Institutes of Health Research; Alberta Innovates; Public Health Agency; Public Health Agency of Canada","keywords":"Missing data; Imputation (statistics); Medicine; Health informatics; Medical record; Data quality; Health care; Data mining; Population; Matching (statistics); Database; Family medicine; Computer science; Public health; Environmental health; Nursing; Machine learning","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1384313,0.00159932,0.00250346,0.005164382,0.001110419,0.003548422,0.005605633,0.001965053,0.001616202],"category_scores_gemma":[0.3351254,0.001188956,0.003224726,0.0091176,0.001086046,0.003893139,0.003639896,0.002946982,0.0003901629],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002398644,"about_ca_system_score_gemma":0.005610289,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008658106,"about_ca_topic_score_gemma":0.006568377,"domain_scores_codex":[0.8905805,0.08567708,0.008117933,0.007657061,0.007231934,0.0007355852],"domain_scores_gemma":[0.6694469,0.264567,0.02363804,0.02218722,0.01913162,0.001029186],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001178494,0.001392588,0.3267183,0.001803589,0.005761605,0.0001847335,0.0019186,0.07977092,0.00113225,0.01267583,0.007380307,0.5600829],"study_design_scores_gemma":[0.0009485699,0.0007178163,0.04826619,0.0005438175,0.0009170474,0.000297575,0.0005392472,0.9125307,0.002056614,0.02869405,0.004355914,0.0001324148],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.05948813,0.0008109631,0.9328626,0.001424103,0.00008907855,0.002001672,0.001339581,0.001225262,0.0007586581],"genre_scores_gemma":[0.1432938,0.0002252793,0.8530887,0.0002779028,0.00007976944,0.001433298,0.001352251,0.00009010392,0.0001588358],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8615687,"threshold_uncertainty_score":0.7321036,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1033849024432202,"score_gpt":0.4127406139001553,"score_spread":0.3093557114569351,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}