{"id":"W3111991384","doi":"10.2196/23086","title":"ALBERT-Based Self-Ensemble Model With Semisupervised Learning and Data Augmentation for Clinical Semantic Textual Similarity Calculation: Algorithm Validation Study","year":2020,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Machine Learning in Healthcare","field":"Computer Science","cited_by":7,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"National Natural Science Foundation of China","keywords":"Computer science; Semantic similarity; Similarity (geometry); Artificial intelligence; Process (computing); Natural language processing; Set (abstract data type); GRASP; Pearson product-moment correlation coefficient; Data set; Machine learning; Information retrieval; Task (project management); Statistics; Mathematics","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004896664,0.001051907,0.00133945,0.001262848,0.0008091381,0.00100251,0.001787264,0.001546283,0.001374655],"category_scores_gemma":[0.009678476,0.0003747318,0.001293247,0.0008596641,0.0006130318,0.001688922,0.001374723,0.001739221,0.0004101674],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001279003,"about_ca_system_score_gemma":0.001635701,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009642578,"about_ca_topic_score_gemma":0.008487353,"domain_scores_codex":[0.9987441,0.0006445083,0.00008269509,0.0002480026,0.0001889839,0.00009161843],"domain_scores_gemma":[0.993194,0.004037849,0.0003444269,0.000578034,0.001626148,0.0002195262],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003182039,0.0003250352,0.009903991,0.0001152867,0.0002529487,0.00009267612,0.0002081618,0.823284,0.001243528,0.004807752,0.003128859,0.1563196],"study_design_scores_gemma":[0.000003897805,0.00001730207,0.0001342048,0.000002259735,0.000007048885,0.000007993232,0.000006530173,0.9988852,0.0002456506,0.0005714754,0.0001152511,0.000003071078],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.18322,0.0009509119,0.8096585,0.0007191296,0.0001704351,0.0002869809,0.0002422455,0.002015897,0.00273584],"genre_scores_gemma":[0.7677736,0.0002691131,0.2276614,0.0002970566,0.00009270677,0.0003154678,0.0008300086,0.0001213276,0.002639344],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.009642578,"threshold_uncertainty_score":0.02589637,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.09368095229211959,"score_gpt":0.4181064391805727,"score_spread":0.3244254868884531,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}