{"id":"W4389520290","doi":"10.18653/v1/2023.findings-emnlp.686","title":"Can Large Language Models Fix Data Annotation Errors? An Empirical Study Using Debatepedia for Query-Focused Text Summarization","year":2023,"lang":"en","type":"article","venue":"","topic":"Topic Modeling","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"Royal Bank of Canada; York University","funders":"Natural Sciences and Engineering Research Council of Canada; York University; Compute Canada","keywords":"Automatic summarization; Computer science; Information retrieval; Relevance (law); Query expansion; RDF query language; Web search query; Task (project management); Query language; Multi-document summarization; Sampling (signal processing); Natural language processing; Web query classification; Language model; Artificial intelligence; Search engine","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0007768782,0.0001350367,0.0001535517,0.0001780114,0.0001916371,0.0002028263,0.0009709405,0.00006575402,0.000006032696],"category_scores_gemma":[0.00009204431,0.0001263296,0.00002442091,0.0006088119,0.000008118132,0.001485831,0.0005269887,0.00007751743,0.000007626305],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00005143111,"about_ca_system_score_gemma":0.0001199728,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0008278607,"about_ca_topic_score_gemma":0.003432322,"domain_scores_codex":[0.9982597,0.0001149721,0.0002873579,0.0006763299,0.0003087116,0.0003529465],"domain_scores_gemma":[0.9984308,0.00009402138,0.00007426363,0.001206614,0.00009955683,0.00009472332],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001036655,0.002555225,0.09062035,0.0001955794,0.000215344,0.000153181,0.2044753,0.466598,0.005168097,0.03696901,0.007617701,0.1853285],"study_design_scores_gemma":[0.0005436532,0.00006296125,0.001250747,0.000005117555,0.00001268407,9.239124e-7,0.001631262,0.9947942,0.00007384028,0.001416651,0.00004288634,0.0001650976],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3956904,0.000005126279,0.6030765,0.0003188072,0.0001408505,0.000382514,0.00003507704,0.0003065238,0.00004415847],"genre_scores_gemma":[0.9182809,8.671793e-7,0.08080105,0.0002180562,0.0001166577,0.00002255043,0.0003399573,0.00001939921,0.0002005429],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.5281962,"threshold_uncertainty_score":0.515157,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1547808426494439,"score_gpt":0.3844682231814402,"score_spread":0.2296873805319963,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}