{"id":"W4389518708","doi":"10.18653/v1/2023.emnlp-main.395","title":"Towards Reliable Misinformation Mitigation: Generalization, Uncertainty, and GPT-4","year":2023,"lang":"en","type":"article","venue":"","topic":"Misinformation and Its Impacts","field":"Social Sciences","cited_by":29,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université de Montréal; McGill University","funders":"Institut de Valorisation des Données; Canadian Institute for Advanced Research","keywords":"Misinformation; Generalization; Computer science; Artificial intelligence; Natural language processing; Epistemology; Philosophy; Computer security","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02319994,0.001568212,0.003096679,0.003608179,0.001505291,0.005661999,0.002828229,0.003890047,0.00448298],"category_scores_gemma":[0.1288507,0.001022097,0.001357251,0.00279614,0.00405419,0.01060714,0.007316106,0.005009735,0.001203919],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002924612,"about_ca_system_score_gemma":0.004367791,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008829017,"about_ca_topic_score_gemma":0.007610212,"domain_scores_codex":[0.9918392,0.005210805,0.0003667428,0.00108361,0.001116039,0.0003836016],"domain_scores_gemma":[0.8720457,0.1025731,0.004265436,0.01054413,0.009168557,0.001403032],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.0008575491,0.000223666,0.01319694,0.0007674165,0.0006775776,0.0002949467,0.001123196,0.3555098,0.001241262,0.1857515,0.02628475,0.4140714],"study_design_scores_gemma":[0.00003913013,0.00006263333,0.001318075,0.0001731679,0.00007399933,0.0001052169,0.0001612015,0.6846158,0.0008498792,0.3099909,0.00257004,0.00003989894],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0702503,0.007516729,0.8869877,0.01635709,0.0003817996,0.0002118307,0.0008584357,0.001298848,0.01613722],"genre_scores_gemma":[0.7809529,0.002414405,0.2091621,0.001370001,0.0006905289,0.0002245341,0.001103287,0.0005140252,0.003568183],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.02319994,"threshold_uncertainty_score":0.1226944,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02628513755310111,"score_gpt":0.3163211441166154,"score_spread":0.2900360065635143,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}