{"id":"W4389086927","doi":"10.2196/50379","title":"Generating Contextual Variables From Web-Based Data for Health Research: Tutorial on Web Scraping, Text Mining, and Spatial Overlay Analysis","year":2023,"lang":"en","type":"article","venue":"JMIR Public Health and Surveillance","topic":"Data-Driven Disease Surveillance","field":"Medicine","cited_by":12,"is_retracted":false,"has_abstract":true,"ca_institutions":"Wilfrid Laurier University; St. Michael's Hospital; Public Health Ontario; University of Toronto","funders":"","keywords":"Computer science; Preprint; Python (programming language); Data mining; World Wide Web; Data science; Information retrieval","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003019822,0.001633403,0.0007985579,0.006283354,0.0005689917,0.001988659,0.001323048,0.0008757322,0.01143608],"category_scores_gemma":[0.01005542,0.0007416741,0.00175429,0.005675968,0.0006305376,0.00289815,0.0016713,0.001832789,0.007695199],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007377501,"about_ca_system_score_gemma":0.001195131,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003454512,"about_ca_topic_score_gemma":0.004827895,"domain_scores_codex":[0.9984134,0.0006322273,0.0001879477,0.0002891204,0.0004249527,0.00005239007],"domain_scores_gemma":[0.9934493,0.004938796,0.0002758473,0.0003453949,0.0008112646,0.0001795003],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00005170686,0.0002280976,0.003713456,0.002432735,0.0001529405,0.0004581798,0.001301605,0.005840781,0.006584142,0.01726874,0.0796636,0.882304],"study_design_scores_gemma":[0.00006167251,0.0002135222,0.01961675,0.00282429,0.000126242,0.001991693,0.001409299,0.06868438,0.01407416,0.09084035,0.7999306,0.0002271101],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.0030803,0.008602969,0.9642242,0.002216798,0.0004542855,0.00129246,0.00592182,0.007434749,0.006772418],"genre_scores_gemma":[0.01001194,0.008629213,0.9688162,0.0007208711,0.0004101683,0.00125376,0.005043009,0.00092869,0.004186259],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01143608,"threshold_uncertainty_score":0.03825748,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1651010824464325,"score_gpt":0.4149373977121152,"score_spread":0.2498363152656827,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}