{"id":"W4391812863","doi":"10.1186/s12911-024-02449-8","title":"Characterizing the limitations of using diagnosis codes in the context of machine learning for healthcare","year":2024,"lang":"en","type":"article","venue":"BMC Medical Informatics and Decision Making","topic":"Medical Coding and Health Information","field":"Health Professions","cited_by":26,"is_retracted":false,"has_abstract":true,"ca_institutions":"Institute for Clinical Evaluative Sciences; SickKids Foundation; Hospital for Sick Children","funders":"","keywords":"Medicine; Health informatics; Context (archaeology); Confidence interval; Medical diagnosis; Odds ratio; Gold standard (test); Diagnostic odds ratio; Concordance; Kappa; Internal medicine; Pediatrics; Emergency medicine; Public health; Pathology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2415519,0.001219503,0.001201673,0.004761649,0.001649311,0.009627521,0.003137953,0.00258088,0.001335588],"category_scores_gemma":[0.6678279,0.0007466502,0.001467022,0.00636225,0.004484227,0.009137831,0.004700257,0.004743963,0.0005638344],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003722529,"about_ca_system_score_gemma":0.005253419,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009014177,"about_ca_topic_score_gemma":0.008787889,"domain_scores_codex":[0.6805353,0.2656377,0.01627943,0.01105151,0.02509229,0.001403914],"domain_scores_gemma":[0.1335636,0.7914244,0.02488639,0.02161585,0.02711052,0.001399199],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001135125,0.0002256869,0.6727214,0.002582751,0.001771148,0.0002362937,0.005158088,0.02452978,0.0007200965,0.02788274,0.01142831,0.2516086],"study_design_scores_gemma":[0.0002789929,0.001353935,0.2896783,0.01086192,0.001080191,0.001576485,0.01036008,0.3577856,0.005102045,0.2682156,0.05322596,0.0004809076],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.5034355,0.0361474,0.3240099,0.08848985,0.002504781,0.001225289,0.005901578,0.0006191647,0.03766645],"genre_scores_gemma":[0.903057,0.002342288,0.08826888,0.003224306,0.001170599,0.0004726218,0.0009732164,0.0001341537,0.0003568809],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.7584481,"threshold_uncertainty_score":0.9353015,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.4599963482276016,"score_gpt":0.5098633561727007,"score_spread":0.04986700794509913,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}