{"id":"W4380200238","doi":"10.1101/2023.06.06.23291031","title":"Improving patient clustering by incorporating structured label relationships in similarity measures","year":2023,"lang":"en","type":"preprint","venue":"medRxiv","topic":"Machine Learning in Healthcare","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Canadian Nautical Research Society","funders":"Institut National de la Santé et de la Recherche Médicale","keywords":"Cosine similarity; Similarity (geometry); Context (archaeology); Similarity measure; Cluster analysis; Matching (statistics); Data mining; Computer science; Medicine; Relevance (law); Jaccard index; Artificial intelligence; Information retrieval; Pathology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003084528,0.0006955399,0.001100942,0.006437499,0.0006362342,0.001836163,0.001003448,0.001189453,0.0009939878],"category_scores_gemma":[0.01778465,0.0002620404,0.0009121182,0.004460818,0.000582197,0.002124602,0.001982419,0.0007949247,0.0003757281],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009409716,"about_ca_system_score_gemma":0.001158786,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003317108,"about_ca_topic_score_gemma":0.003451486,"domain_scores_codex":[0.9958541,0.001531513,0.0004704956,0.0007353355,0.001197132,0.0002114372],"domain_scores_gemma":[0.9899874,0.005126131,0.00174487,0.001205232,0.001630627,0.0003057739],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0008321504,0.001016546,0.1185865,0.0005347443,0.000837747,0.0002571998,0.0009312366,0.3066588,0.01043204,0.0161767,0.00674208,0.5369943],"study_design_scores_gemma":[0.00004165107,0.0003036977,0.0180018,0.000062235,0.0001182276,0.000205173,0.0002586027,0.9583984,0.004464387,0.0161886,0.001909167,0.00004803757],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.3394372,0.0008247506,0.6550017,0.0004538769,0.00008476948,0.0002899546,0.0008706336,0.0007287682,0.002308421],"genre_scores_gemma":[0.7810695,0.0001616702,0.2164295,0.0001097726,0.0001028835,0.0001370158,0.001462635,0.00005420379,0.0004728064],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.006437499,"threshold_uncertainty_score":0.01631272,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.07717469127203024,"score_gpt":0.3006638795375303,"score_spread":0.2234891882655001,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}