{"id":"W4413467890","doi":"10.2196/68558","title":"Generative Models and Sentence Transformers for the Recognition and Normalization of Continuous and Discontinuous Phenotype Mentions: Model Development and Evaluation","year":2025,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Biomedical Text Mining and Ontologies","field":"Biochemistry, Genetics and Molecular Biology","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Preprint; Transformer; Generative grammar; Computer science; Sentence; Artificial intelligence; Coronavirus disease 2019 (COVID-19); Natural language processing; Medicine; Engineering; Pathology; World Wide Web; Electrical engineering","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0004446423,0.00007574032,0.0001088882,0.00002928038,0.0001024045,0.00001935896,0.00003305194,0.0001188664,0.000001062541],"category_scores_gemma":[0.0001205675,0.00005131143,0.00001164687,0.00003828409,0.0002630074,0.00001475469,0.00004240668,0.0000479869,3.927224e-8],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000004848595,"about_ca_system_score_gemma":0.00009166899,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000003152867,"about_ca_topic_score_gemma":0.00001885709,"domain_scores_codex":[0.9993938,0.00001994293,0.0002687836,0.00008260983,0.0001467895,0.00008803602],"domain_scores_gemma":[0.9996877,0.00004895413,0.00007135485,0.00004182369,0.0001027937,0.00004736484],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00007499031,0.00002798296,0.0001150258,0.0002521938,0.00008364853,5.487245e-8,0.004391227,0.00004699497,0.0007902036,0.0003182506,0.0002613191,0.9936381],"study_design_scores_gemma":[0.00168307,0.0001774799,0.0005128589,0.0001648879,0.0001040082,0.000006941601,0.006292815,0.9838309,0.003353722,0.002627422,0.001116187,0.000129665],"study_design_candidate":"design_other","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.5823713,0.001284227,0.4154576,0.0003351994,0.00002334168,0.000389945,0.000014857,0.000004333669,0.0001191605],"genre_scores_gemma":[0.9810874,0.001915352,0.01622823,0.0003881069,0.00001437888,0.0001674967,0.0001422543,0.000003756484,0.00005305047],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9935085,"threshold_uncertainty_score":0.209242,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04340515198957854,"score_gpt":0.3216704328808726,"score_spread":0.278265280891294,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}