{"id":"W4379374334","doi":"10.21428/594757db.0b1f96f6","title":"ChartSumm: A Comprehensive Benchmark for Automatic Chart Summarization of Long and Short Summaries","year":2023,"lang":"en","type":"preprint","venue":"","topic":"Topic Modeling","field":"Computer Science","cited_by":12,"is_retracted":false,"has_abstract":true,"ca_institutions":"York University","funders":"","keywords":"Computer science; Automatic summarization; Benchmark (surveying); Chart; Metadata; Data mining; Information retrieval; Artificial intelligence; Natural language processing; World Wide Web","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003991465,0.0023379,0.0008125087,0.008545877,0.001449677,0.002422294,0.002584243,0.002034237,0.007759696],"category_scores_gemma":[0.02750558,0.0003538806,0.001461165,0.00663903,0.0006545553,0.004001163,0.002273267,0.001528387,0.006576571],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001897387,"about_ca_system_score_gemma":0.002951841,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01144669,"about_ca_topic_score_gemma":0.0171907,"domain_scores_codex":[0.9959346,0.001348546,0.0006292584,0.0007983315,0.001041645,0.0002475668],"domain_scores_gemma":[0.9858132,0.006164976,0.00103122,0.002700551,0.003554251,0.0007357879],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.001231876,0.0006978959,0.00745069,0.005703979,0.0002826054,0.0005115132,0.0009742674,0.02060228,0.01160141,0.005809583,0.6649569,0.2801771],"study_design_scores_gemma":[0.0009038672,0.001405602,0.02486277,0.001063262,0.000289446,0.0009450779,0.002548844,0.2467125,0.0502149,0.01636182,0.6543356,0.0003563201],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"dataset","genre_gemma":"empirical","genre_scores_codex":[0.1026668,0.0105209,0.08354975,0.002438832,0.001767077,0.001769623,0.6430817,0.1379092,0.01629604],"genre_scores_gemma":[0.06894537,0.00119717,0.1201052,0.0002894115,0.0002108179,0.001121962,0.8018644,0.002257393,0.004008234],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01144669,"threshold_uncertainty_score":0.02595878,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0721323320600067,"score_gpt":0.2976251434578269,"score_spread":0.2254928113978202,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}