{"id":"W4414167289","doi":"10.1007/s10067-025-07640-4","title":"Comparative evaluation of large language models in delivering guideline-compliant recommendations for topical NSAID use in musculoskeletal pain: a multidimensional analysis","year":2025,"lang":"en","type":"article","venue":"Clinical Rheumatology","topic":"Health Literacy and Information Accessibility","field":"Health Professions","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"Hospital for Sick Children","funders":"Zhejiang Chinese Medical University","keywords":"Readability; Limiting; Function (biology); Clinical Practice; MEDLINE; Usability; Clinical judgment; Clinical trial","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.01732187,0.0001282608,0.0009278217,0.0004786036,0.0001618471,0.000004144056,0.00014764,0.0003180866,0.0003420968],"category_scores_gemma":[0.008609691,0.0001116051,0.0002103535,0.0007034108,0.00006774731,0.0004110807,0.0001216403,0.0005603918,0.00001021744],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001792968,"about_ca_system_score_gemma":0.000609874,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001223679,"about_ca_topic_score_gemma":0.008039859,"domain_scores_codex":[0.9903713,0.004106858,0.004621416,0.00033932,0.0001803453,0.0003808004],"domain_scores_gemma":[0.9890969,0.008979769,0.0006480735,0.0003404004,0.0008513184,0.00008356839],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003673708,0.0006516422,0.9540371,0.0003999446,0.0001469342,4.135374e-7,0.004236802,0.004105126,0.000002685397,0.01957067,0.002821903,0.01365938],"study_design_scores_gemma":[0.003162074,0.00004664048,0.1688417,0.0002344722,0.00006137929,1.049479e-7,0.002169776,0.8219994,0.000001082947,0.001454582,0.001950373,0.00007842051],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8682966,0.00007994285,0.1279272,0.001802823,0.0003166613,0.001247087,0.00009311199,0.00001895997,0.0002176279],"genre_scores_gemma":[0.9755972,0.00003363949,0.02159315,0.0018937,0.000009800139,0.0003405907,0.0004983449,0.000004124854,0.00002942291],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.8178943,"threshold_uncertainty_score":0.9997412,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2507076386285519,"score_gpt":0.5934160365773098,"score_spread":0.3427083979487578,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}