{"id":"W4392824891","doi":"10.2196/55762","title":"Assessing the Accuracy of Generative Conversational Artificial Intelligence in Debunking Sleep Health Myths: Mixed Methods Comparative Study With Expert Analysis","year":2024,"lang":"en","type":"article","venue":"JMIR Formative Research","topic":"Sleep and related disorders","field":"Psychology","cited_by":14,"is_retracted":false,"has_abstract":true,"ca_institutions":"York University","funders":"","keywords":"Preprint; Mythology; Generative grammar; Artificial intelligence; Computer science; Psychology; Art; World Wide Web; Literature","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1517674,0.0009811994,0.002053664,0.004797359,0.002678665,0.004514267,0.002570158,0.001844027,0.003042253],"category_scores_gemma":[0.274197,0.001535774,0.00299073,0.002195645,0.003218982,0.004083937,0.004938294,0.001820731,0.0006724483],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.004104505,"about_ca_system_score_gemma":0.003491191,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002137696,"about_ca_topic_score_gemma":0.003889352,"domain_scores_codex":[0.8686316,0.1010199,0.01216333,0.006494306,0.0094303,0.002260462],"domain_scores_gemma":[0.5675399,0.3589624,0.02659361,0.0140423,0.0310679,0.001793932],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"observational","study_design_scores_codex":[0.007524171,0.007852125,0.1850639,0.009048724,0.003334215,0.0005621238,0.6102836,0.001794642,0.003026453,0.00382349,0.001898748,0.1657877],"study_design_scores_gemma":[0.00486749,0.03569028,0.3842548,0.01044134,0.005387749,0.001274405,0.4766479,0.03355667,0.01202591,0.01520882,0.01943589,0.001208754],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9695008,0.00102737,0.01438893,0.0003232929,0.00007549888,0.0106766,0.0003251137,0.00004735078,0.003635066],"genre_scores_gemma":[0.9350141,0.000693941,0.03142542,0.0006723669,0.00008716152,0.03080646,0.000360821,0.00005046678,0.0008892934],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1517674,"threshold_uncertainty_score":0.8026324,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2163673159729025,"score_gpt":0.5846408144291358,"score_spread":0.3682734984562333,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}