{"id":"W2111589117","doi":"10.1186/1471-2288-14-36","title":"Evaluating bias due to data linkage error in electronic healthcare records","year":2014,"lang":"en","type":"article","venue":"BMC Medical Research Methodology","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":102,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Hospital for Sick Children; Intensive Care Society; Medical Research Council; National Institute for Health and Care Research; NHS Health Scotland","keywords":"Identifier; Record linkage; Linkage (software); Gold standard (test); Word error rate; Computer science; Imputation (statistics); Statistics; Probabilistic logic; Data mining; Missing data; Data set; Standard error; Medicine; Artificial intelligence; Mathematics; Population","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[{"model":"gemma","categories":["metaresearch"],"domain":"methods","study_design":"observational","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"},{"model":"gpt","categories":["metaresearch"],"domain":"methods","study_design":"design_other","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"high","status":"direct model label, unvalidated"}],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2920585,0.001251422,0.001355378,0.00356387,0.001461544,0.003109443,0.002622853,0.003353943,0.001347696],"category_scores_gemma":[0.6219704,0.0008683711,0.003603958,0.00530771,0.003180064,0.003286317,0.003829881,0.002096628,0.0002777989],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003273034,"about_ca_system_score_gemma":0.002624873,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00579774,"about_ca_topic_score_gemma":0.003832425,"domain_scores_codex":[0.6504805,0.296124,0.01964494,0.01332273,0.01866843,0.0017593],"domain_scores_gemma":[0.1323357,0.8055772,0.02718792,0.02108588,0.01326839,0.0005448596],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.003490087,0.0003615389,0.6371357,0.002600863,0.008001065,0.0005835603,0.003657616,0.1787681,0.001127893,0.01652174,0.003997956,0.1437538],"study_design_scores_gemma":[0.001501184,0.003543039,0.263045,0.004257542,0.00660512,0.002989262,0.002182832,0.5890253,0.01670342,0.09093112,0.01855426,0.0006618709],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.5200224,0.007986601,0.456643,0.003435411,0.0007748945,0.002537697,0.003476059,0.001010333,0.004113542],"genre_scores_gemma":[0.8706078,0.0006958083,0.1230414,0.0009345977,0.0002303898,0.001311058,0.002383546,0.0001809952,0.0006145058],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.7079415,"threshold_uncertainty_score":0.873018,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.9728506852504919,"score_gpt":0.764426510343351,"score_spread":0.2084241749071409,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}