{"id":"W4389520290","doi":"10.18653/v1/2023.findings-emnlp.686","title":"Can Large Language Models Fix Data Annotation Errors? An Empirical Study Using Debatepedia for Query-Focused Text Summarization","year":2023,"lang":"en","type":"article","venue":"","topic":"Topic Modeling","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"Royal Bank of Canada; York University","funders":"Natural Sciences and Engineering Research Council of Canada; York University; Compute Canada","keywords":"Automatic summarization; Computer science; Information retrieval; Relevance (law); Query expansion; RDF query language; Web search query; Task (project management); Query language; Multi-document summarization; Sampling (signal processing); Natural language processing; Web query classification; Language model; Artificial intelligence; Search engine","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01916592,0.001043594,0.001078613,0.002421211,0.001201896,0.002033363,0.002038692,0.001511821,0.001685748],"category_scores_gemma":[0.1064623,0.00040336,0.001190047,0.003294034,0.001280261,0.004894752,0.00137861,0.003247451,0.00172941],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00132099,"about_ca_system_score_gemma":0.001361239,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00536709,"about_ca_topic_score_gemma":0.00632769,"domain_scores_codex":[0.9821647,0.01315212,0.001029575,0.002177391,0.001152242,0.0003238639],"domain_scores_gemma":[0.8639822,0.1155333,0.004398963,0.01084596,0.004471158,0.0007682734],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.005066824,0.002963445,0.1748653,0.006008585,0.001560277,0.001222858,0.009757915,0.09201641,0.01999983,0.01001372,0.1084889,0.568036],"study_design_scores_gemma":[0.001137693,0.002386794,0.08164338,0.0005986855,0.001048533,0.001577001,0.007064995,0.7729041,0.03190775,0.01791702,0.08149057,0.00032349],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8596902,0.006128082,0.09926151,0.003617256,0.0003944303,0.0008652581,0.01949783,0.006594177,0.00395124],"genre_scores_gemma":[0.8742853,0.0007097392,0.07299417,0.0007225241,0.0002269819,0.0007655544,0.04839371,0.0004702788,0.001431798],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01916592,"threshold_uncertainty_score":0.1013603,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1547808426494439,"score_gpt":0.3844682231814402,"score_spread":0.2296873805319963,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}