{"id":"W2952088026","doi":"10.2196/14499","title":"Projection Word Embedding Model With Hybrid Sampling Training for Classifying ICD-10-CM Codes: Longitudinal Observational Study","year":2019,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Machine Learning in Healthcare","field":"Computer Science","cited_by":14,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Word2vec; Word embedding; Computer science; Artificial intelligence; Natural language processing; Diagnosis code; Vocabulary; Word (group theory); Data mining; Embedding; Information retrieval; Machine learning; Medicine; Mathematics; Linguistics","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001516442,0.0002484381,0.0003807255,0.0001967396,0.0003335283,0.0002569593,0.0008126009,0.0001198511,0.00004526163],"category_scores_gemma":[0.0003247715,0.0002029437,0.00007077152,0.0004158972,0.00004796678,0.0012017,0.0002415699,0.0007037075,0.00002559651],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000172132,"about_ca_system_score_gemma":0.0008347633,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00001420936,"about_ca_topic_score_gemma":0.00001501858,"domain_scores_codex":[0.9967583,0.00006188398,0.0008763416,0.0003066496,0.001445077,0.000551687],"domain_scores_gemma":[0.9979593,0.0005991557,0.0004110445,0.0004796878,0.0002907283,0.0002600964],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0004255115,0.0007729337,0.2170809,0.003827618,0.0003086851,0.00002473163,0.1514208,0.3846793,0.00001418952,0.02056034,0.002049956,0.2188351],"study_design_scores_gemma":[0.001099303,0.0004693985,0.004910117,0.0003259005,0.000009669232,0.00005091032,0.003341473,0.9886647,0.000002694662,0.0002728874,0.0005966421,0.0002562541],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.4081853,0.000004319538,0.5895725,0.0004324341,0.0001703406,0.001112428,0.000003722662,0.0002177768,0.0003011939],"genre_scores_gemma":[0.7275535,0.000001191935,0.2712853,0.0005151826,0.0001309233,0.0002938015,0.0000342237,0.00001980158,0.0001660061],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.6039855,"threshold_uncertainty_score":0.8275803,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1962135696598163,"score_gpt":0.4181820182667698,"score_spread":0.2219684486069535,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}