{"id":"W4416183196","doi":"10.1109/gaclm67198.2025.11231924","title":"Hallucinations in Abstractive Text Summarization with Large Language Models","year":2025,"lang":"","type":"article","venue":"","topic":"Topic Modeling","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Lethbridge","funders":"","keywords":"Automatic summarization; Language model; Text graph; Source text; Natural language; Deep learning; Multi-document summarization","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001921352,0.001566567,0.0009443234,0.001533003,0.0005016541,0.001486317,0.001211926,0.001025641,0.001680356],"category_scores_gemma":[0.007747447,0.0004206969,0.0009074926,0.001124118,0.0005788305,0.003137063,0.001458664,0.001626532,0.001515564],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005977568,"about_ca_system_score_gemma":0.0006755563,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002843603,"about_ca_topic_score_gemma":0.004927535,"domain_scores_codex":[0.998844,0.0004919727,0.0001031524,0.0002821139,0.0002025252,0.00007622559],"domain_scores_gemma":[0.9968009,0.001898202,0.0003197745,0.000422269,0.0004508283,0.0001080691],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.001135257,0.000315583,0.001955523,0.0009113978,0.000315552,0.0006428386,0.001262429,0.1160016,0.04009829,0.004725833,0.01747599,0.8151597],"study_design_scores_gemma":[0.0001795507,0.0004907214,0.001505632,0.00006385801,0.0001654553,0.0002036187,0.0005065171,0.9364473,0.03114945,0.01576469,0.01345055,0.0000726581],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.07729053,0.004388495,0.8996548,0.001016109,0.000290339,0.0002554325,0.001918143,0.01295805,0.002228078],"genre_scores_gemma":[0.5143996,0.001924201,0.4621374,0.0006579361,0.0006878186,0.0004205678,0.01151671,0.0007435319,0.007512286],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.002843603,"threshold_uncertainty_score":0.01016122,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01288760711746817,"score_gpt":0.2638264189685486,"score_spread":0.2509388118510804,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}