{"id":"W3095642204","doi":"10.2196/19735","title":"Measurement of Semantic Textual Similarity in Clinical Texts: Comparison of Transformer-Based Models","year":2020,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Topic Modeling","field":"Computer Science","cited_by":59,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"National Center for Chronic Disease Prevention and Health Promotion; Clinical and Translational Science Institute, University of Florida; National Center for Advancing Translational Sciences; University of Florida; National Cancer Institute; National Institutes of Health; Nvidia; Centers for Disease Control and Prevention; National Institute on Aging; Patient-Centered Outcomes Research Institute","keywords":"Computer science; Natural language processing; Semantic similarity; Artificial intelligence; Similarity (geometry); Transformer; Domain (mathematical analysis); Information retrieval; Biomedical text mining; Text mining","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005016176,0.001312858,0.0007659723,0.00393894,0.0004204896,0.001621273,0.001384937,0.001176812,0.002159389],"category_scores_gemma":[0.01737317,0.0003293096,0.001279653,0.001895636,0.0006506903,0.003366594,0.00155574,0.001765928,0.001469155],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002334028,"about_ca_system_score_gemma":0.001668399,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01307806,"about_ca_topic_score_gemma":0.01538181,"domain_scores_codex":[0.9978505,0.0009098941,0.0001854051,0.0005100623,0.0004130563,0.0001310462],"domain_scores_gemma":[0.9908325,0.006475816,0.0004330568,0.0006772272,0.001264168,0.0003172868],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.002330955,0.0009933824,0.04341828,0.000688092,0.0007917401,0.0003579667,0.0008116547,0.3074771,0.005552152,0.009149016,0.01560237,0.6128273],"study_design_scores_gemma":[0.00002927796,0.0002683384,0.003564548,0.00004756076,0.00008953998,0.0001329543,0.0001641555,0.9873213,0.001889904,0.005370048,0.001093614,0.00002878929],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6021012,0.008245749,0.3559785,0.003234856,0.0007921873,0.0006851774,0.005281795,0.007627548,0.01605303],"genre_scores_gemma":[0.9419789,0.00135615,0.0470772,0.0003250547,0.0001554787,0.0001723525,0.005590871,0.0002090734,0.003134949],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01307806,"threshold_uncertainty_score":0.02652842,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1322531638745227,"score_gpt":0.3662089841932468,"score_spread":0.2339558203187241,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}