{"id":"W4404911180","doi":"10.2196/63188","title":"Comparing the Accuracy of Two Generated Large Language Models in Identifying Health-Related Rumors or Misconceptions and the Applicability in Health Science Popularization: Proof-of-Concept Study","year":2024,"lang":"en","type":"article","venue":"JMIR Formative Research","topic":"Misinformation and Its Impacts","field":"Social Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"National Natural Science Foundation of China","keywords":"Readability; Social media; Psychology; Social psychology; Computer science; Political science; Law","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01952535,0.00007947175,0.0002598629,0.0003950483,0.0009833383,0.0002390892,0.0004329322,0.00002900577,0.00004482235],"category_scores_gemma":[0.0005803957,0.00004464738,0.00002621185,0.004107409,0.001413255,0.001363579,0.0001917157,0.0004991939,0.000001925382],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003455242,"about_ca_system_score_gemma":0.001441984,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01050139,"about_ca_topic_score_gemma":0.009017919,"domain_scores_codex":[0.9960912,0.001437038,0.0008063132,0.0001734095,0.0009930943,0.000498931],"domain_scores_gemma":[0.9987461,0.000520328,0.0002019855,0.0002208001,0.0002068031,0.0001039863],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"qualitative","study_design_scores_codex":[0.00003763067,0.0001528656,0.001308598,0.0001390974,0.00000624464,4.893725e-7,0.9385884,0.001257096,0.000007987704,0.05305257,0.00005840496,0.005390591],"study_design_scores_gemma":[0.002024267,0.000153727,0.02333458,0.0003895703,0.000001532343,0.000001682914,0.7251488,0.2448224,0.0001380687,0.003836482,0.00005705881,0.00009177093],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9914895,0.000700816,0.0008354743,0.002731035,0.00004881463,0.003115206,0.00001251625,0.00001995717,0.001046637],"genre_scores_gemma":[0.9997339,0.00003860997,0.000029552,0.00003855132,0.00001177855,0.00006991321,0.000006106942,0.000004314474,0.00006727366],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.2435653,"threshold_uncertainty_score":0.9960878,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2037425647841682,"score_gpt":0.528724420201297,"score_spread":0.3249818554171288,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}