{"id":"W4407006035","doi":"10.1177/23743735241309468","title":"Developing and Validating a User-Friendly Quality Benchmark: Enhancing the Integrity of Online Health Information for Patients and Clinicians","year":2025,"lang":"en","type":"article","venue":"Journal of Patient Experience","topic":"Health Literacy and Information Accessibility","field":"Health Professions","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université de Montréal","funders":"Fonds de Recherche du Québec - Santé; Social Sciences and Humanities Research Council of Canada","keywords":"Benchmark (surveying); Misinformation; Quality (philosophy); Computer science; Health care; Reliability (semiconductor); Dissemination; Set (abstract data type); Knowledge management; Computer security","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003782414,0.000103008,0.0003565855,0.0001307238,0.0007299014,0.00002407614,0.000154033,0.00008285253,0.000007657731],"category_scores_gemma":[0.005453081,0.00006680013,0.00004589188,0.0002336869,0.00008415024,0.001645579,0.0001244691,0.00048018,2.39474e-7],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001961086,"about_ca_system_score_gemma":0.001072382,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001612848,"about_ca_topic_score_gemma":0.00006899434,"domain_scores_codex":[0.9950293,0.000514732,0.003851785,0.00009251645,0.0002654906,0.0002461252],"domain_scores_gemma":[0.9935514,0.001479742,0.003519522,0.0001428194,0.001212658,0.00009380419],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0003748073,0.0001514639,0.6059189,0.002947974,0.00001896956,4.206387e-8,0.2432748,0.00000518401,0.00001783109,0.006793043,0.000640016,0.139857],"study_design_scores_gemma":[0.00268031,0.001191671,0.6656073,0.003632298,0.00001477092,0.000001371098,0.2793905,0.001229454,0.0003923204,0.001031171,0.04461612,0.0002126437],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.947356,0.00009255014,0.04967616,0.001391088,0.0006059071,0.0007579194,0.00004511777,0.000005836259,0.00006941568],"genre_scores_gemma":[0.9692388,0.0001159772,0.02528686,0.005279198,0.0000294945,0.00002517246,0.00001680613,0.000002539662,0.000005128561],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1396443,"threshold_uncertainty_score":0.6528241,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.07289979831256437,"score_gpt":0.5120626335239368,"score_spread":0.4391628352113724,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}