{"id":"W4380200238","doi":"10.1101/2023.06.06.23291031","title":"Improving patient clustering by incorporating structured label relationships in similarity measures","year":2023,"lang":"en","type":"preprint","venue":"medRxiv","topic":"Machine Learning in Healthcare","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Canadian Nautical Research Society","funders":"Institut National de la Santé et de la Recherche Médicale","keywords":"Cosine similarity; Similarity (geometry); Context (archaeology); Similarity measure; Cluster analysis; Matching (statistics); Data mining; Computer science; Medicine; Relevance (law); Jaccard index; Artificial intelligence; Information retrieval; Pathology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","research_integrity"],"consensus_categories":[],"category_scores_codex":[0.002203411,0.0003858377,0.0004446908,0.0003646229,0.0003179168,0.00031966,0.00147288,0.0004726632,0.000002877948],"category_scores_gemma":[0.002657724,0.0004094176,0.00007455502,0.000616262,0.0000406127,0.0002234436,0.003508815,0.003558314,0.00001447311],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003233129,"about_ca_system_score_gemma":0.0002943268,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002509082,"about_ca_topic_score_gemma":0.003857784,"domain_scores_codex":[0.9955589,0.001154513,0.0008989027,0.001156409,0.0007301072,0.0005012286],"domain_scores_gemma":[0.9971824,0.000466663,0.0007081268,0.001312613,0.0001671113,0.0001631285],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000008971831,0.00004107741,0.9057714,0.0009712744,0.00002235001,0.00006919265,0.004358431,0.04235322,0.0009102307,0.001005766,0.000262149,0.04422596],"study_design_scores_gemma":[0.0002166997,0.00004175255,0.1208536,0.0003828475,0.000005195383,0.000004144829,0.00006387462,0.8672277,0.0001461047,0.01047301,0.0001063446,0.0004788268],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7239259,0.0004163322,0.2675411,0.003171035,0.002693164,0.0009644097,0.00004143548,0.001093053,0.0001536525],"genre_scores_gemma":[0.9363452,0.000009072698,0.06316998,0.0001297484,0.00009182217,0.0001048114,0.00004941445,0.00005431591,0.00004562262],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.8248744,"threshold_uncertainty_score":0.9998358,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.07717469127203024,"score_gpt":0.3006638795375303,"score_spread":0.2234891882655001,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}