{"id":"W3161027543","doi":"10.2196/29667","title":"A Word Pair Dataset for Semantic Similarity and Relatedness in Korean Medical Vocabulary: Reference Development and Validation","year":2021,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Biomedical Text Mining and Ontologies","field":"Biochemistry, Genetics and Molecular Biology","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Korea Health Industry Development Institute","keywords":"Natural language processing; Computer science; Similarity (geometry); Vocabulary; Word (group theory); Word embedding; Task (project management); Artificial intelligence; Semantic similarity; Set (abstract data type); Health informatics; Information retrieval; Unified Medical Language System; Embedding; Linguistics; Medicine; Pathology","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0007471628,0.0001290586,0.0002038198,0.00003816083,0.00006756523,0.00002876278,0.0001447122,0.000517355,0.00002444597],"category_scores_gemma":[0.001471908,0.0001065176,0.0000163699,0.00009762042,0.0002307114,0.000009546488,0.0002840509,0.0002534702,0.000001987278],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00001133617,"about_ca_system_score_gemma":0.0004739629,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000004566531,"about_ca_topic_score_gemma":0.00006443362,"domain_scores_codex":[0.9986793,0.00005203158,0.0004708447,0.0001771316,0.0003870272,0.0002336984],"domain_scores_gemma":[0.9992765,0.00008106197,0.00007523546,0.0001831633,0.00004943377,0.0003345897],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0002616571,0.0005621199,0.01476409,0.002157592,0.0002060003,0.0001872383,0.005969424,0.000002026382,0.0006575257,0.0007603762,0.05905255,0.9154194],"study_design_scores_gemma":[0.006201419,0.0004758747,0.009646974,0.001143464,0.00005579841,0.0006905619,0.00525369,0.01123258,0.01889605,0.0006717288,0.9447927,0.0009391198],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9920704,0.000422063,0.005095348,0.001946168,0.00007806964,0.0001982585,0.000078606,0.00001863608,0.00009247533],"genre_scores_gemma":[0.9488764,0.001154586,0.03248727,0.003832836,0.000137924,0.0001626393,0.0131941,0.00002318671,0.0001310382],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9144803,"threshold_uncertainty_score":0.4343661,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03191483108306381,"score_gpt":0.317044660720137,"score_spread":0.2851298296370732,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}