{"id":"W4385570371","doi":"10.18653/v1/2023.findings-acl.29","title":"A Systematic Study and Comprehensive Evaluation of ChatGPT on Benchmark Datasets","year":2023,"lang":"en","type":"article","venue":"","topic":"Topic Modeling","field":"Computer Science","cited_by":78,"is_retracted":false,"has_abstract":true,"ca_institutions":"Royal Bank of Canada; York University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Automatic summarization; Benchmark (surveying); Computer science; Variety (cybernetics); Strengths and weaknesses; Artificial intelligence; Machine translation; Machine learning; Data science; Benchmarking; Generative grammar; Ground truth; Natural language processing","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01453335,0.003927973,0.00207714,0.004948063,0.002220035,0.003518627,0.005858508,0.002990917,0.005283283],"category_scores_gemma":[0.06078595,0.0009398512,0.002581227,0.004883009,0.00152377,0.008354672,0.005137844,0.005152842,0.005728723],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003363448,"about_ca_system_score_gemma":0.003583676,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01381129,"about_ca_topic_score_gemma":0.02533672,"domain_scores_codex":[0.9826034,0.009935427,0.001284201,0.003198586,0.002463438,0.0005149803],"domain_scores_gemma":[0.9583851,0.02548428,0.001220286,0.008475893,0.005163062,0.001271442],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.002145507,0.002225971,0.02651168,0.01138043,0.001848899,0.0007954297,0.002247762,0.08504689,0.01168902,0.007666118,0.3557232,0.4927192],"study_design_scores_gemma":[0.0009795175,0.002853927,0.02856251,0.001659987,0.0008075238,0.001852458,0.003657517,0.7164046,0.02790084,0.0157899,0.1990321,0.0004992674],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.3329892,0.02370905,0.271501,0.006808559,0.003538876,0.006482657,0.146273,0.1793512,0.02934637],"genre_scores_gemma":[0.308163,0.003405643,0.2685525,0.002618277,0.0005265574,0.00483622,0.3982425,0.006295273,0.00735991],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01453335,"threshold_uncertainty_score":0.07686067,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.09181622296375748,"score_gpt":0.3453522069405535,"score_spread":0.2535359839767961,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}