{"id":"W4408723321","doi":"10.1038/s41598-025-94208-6","title":"Evaluating the quality of medical content on YouTube using large language models","year":2025,"lang":"en","type":"article","venue":"Scientific Reports","topic":"Health Literacy and Information Accessibility","field":"Health Professions","cited_by":15,"is_retracted":false,"has_abstract":true,"ca_institutions":"Western University","funders":"","keywords":"Computer science; Quality (philosophy); Content (measure theory); Information retrieval; World Wide Web; Natural language processing; Data science; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.02326674,0.001048501,0.0008089287,0.004049201,0.0006362455,0.002253855,0.0007329845,0.0008652754,0.001033279],"category_scores_gemma":[0.09347731,0.0002531607,0.001048812,0.001694768,0.0005981409,0.002716194,0.001554433,0.001006444,0.0004224096],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002124106,"about_ca_system_score_gemma":0.001214035,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01581636,"about_ca_topic_score_gemma":0.02416971,"domain_scores_codex":[0.9869963,0.008828782,0.001018214,0.001300337,0.001562383,0.0002939239],"domain_scores_gemma":[0.8859093,0.09550373,0.005424872,0.003019045,0.009129402,0.001013545],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00204846,0.001351676,0.5882483,0.001547678,0.001378181,0.000574124,0.008480513,0.09236597,0.007048947,0.002257645,0.01130993,0.2833886],"study_design_scores_gemma":[0.0001001792,0.0009718853,0.1269576,0.00024588,0.0002890379,0.0001994077,0.002914516,0.8565452,0.005814186,0.002689764,0.003110976,0.0001613718],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.946833,0.0008016519,0.04473948,0.0007616717,0.00009295436,0.0004518196,0.002087449,0.0006458221,0.003586107],"genre_scores_gemma":[0.9692355,0.0001726949,0.02717642,0.00009425353,0.00003726831,0.0001656147,0.002391658,0.0000406504,0.0006858676],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9767333,"threshold_uncertainty_score":0.1230478,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.4075784556483751,"score_gpt":0.6109498637059566,"score_spread":0.2033714080575815,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}