{"id":"W4412982374","doi":"10.2196/71252","title":"Large Language Models for Automating Clinical Trial Criteria Conversion to Observational Medical Outcomes Partnership Common Data Model Queries: Validation and Evaluation Study","year":2025,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Electronic Health Records Systems","field":"Health Professions","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Preprint; Computer science; Data mining; Information retrieval; Database; World Wide Web","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01060545,0.001546183,0.000600044,0.001326516,0.0004020885,0.001848328,0.0025838,0.001143514,0.003677974],"category_scores_gemma":[0.04649754,0.0005435852,0.001535336,0.0009294656,0.0005838556,0.002523349,0.002221449,0.001919724,0.001875405],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001556189,"about_ca_system_score_gemma":0.003500643,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009925308,"about_ca_topic_score_gemma":0.009243264,"domain_scores_codex":[0.9937199,0.003358655,0.0007401468,0.0009260075,0.001054918,0.0002004201],"domain_scores_gemma":[0.9686005,0.02465919,0.001151656,0.00236132,0.002712565,0.0005148742],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.007499648,0.003935957,0.04031257,0.004713964,0.001238309,0.001855268,0.003410073,0.1777556,0.04359213,0.009876224,0.09009802,0.6157123],"study_design_scores_gemma":[0.001060393,0.001088463,0.00493767,0.0001439576,0.0002278433,0.0004407292,0.000449559,0.9455547,0.02401245,0.004422025,0.01756445,0.00009767017],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3855085,0.001643919,0.4326394,0.002623114,0.000464908,0.003819953,0.01687231,0.1529616,0.003466337],"genre_scores_gemma":[0.4967387,0.0005153504,0.4699215,0.001112306,0.00007876545,0.001676159,0.02585766,0.002404975,0.001694674],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01060545,"threshold_uncertainty_score":0.05608761,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.4929402207499786,"score_gpt":0.6419808399909626,"score_spread":0.1490406192409839,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}