{"id":"W4416690823","doi":"10.2196/78289","title":"Accuracy of Large Language Model Responses Versus Internet Searches for Common Questions About Glucagon-Like Peptide-1 Receptor Agonist Therapy: Exploratory Simulation Study","year":2025,"lang":"en","type":"article","venue":"JMIR Formative Research","topic":"Health Literacy and Information Accessibility","field":"Health Professions","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Readability; The Internet; Relevance (law); Concordance; Language model; Weighting; Exploratory research","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.07322877,0.0007678538,0.001014568,0.001971264,0.000695097,0.002515322,0.001308406,0.001564288,0.002610943],"category_scores_gemma":[0.3545673,0.000697911,0.002496239,0.002085644,0.001940804,0.002723499,0.002635848,0.001915184,0.0007586986],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002931181,"about_ca_system_score_gemma":0.002232835,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003819047,"about_ca_topic_score_gemma":0.002258026,"domain_scores_codex":[0.9031793,0.08188012,0.005429838,0.003443738,0.004568794,0.001498182],"domain_scores_gemma":[0.3463467,0.6093886,0.02157496,0.0118973,0.009616334,0.001176164],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.02304706,0.01352271,0.7636956,0.001935422,0.001639552,0.0004467792,0.07729822,0.04208223,0.003090782,0.00193807,0.00149452,0.06980919],"study_design_scores_gemma":[0.003857004,0.05835503,0.4983829,0.0009649087,0.001648078,0.0009357113,0.05106695,0.3608931,0.0109422,0.0069456,0.005365132,0.0006434166],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9958324,0.00003221624,0.002366634,0.00009228264,0.000008778601,0.0005808234,0.0002153167,0.00003101046,0.0008404427],"genre_scores_gemma":[0.9919533,0.0000516027,0.005773472,0.0001044537,0.00001422546,0.001429504,0.0003631126,0.00002325769,0.0002871491],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.07322877,"threshold_uncertainty_score":0.3872754,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2260822174480123,"score_gpt":0.5956738780693862,"score_spread":0.3695916606213739,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}