{"id":"W4385570832","doi":"10.18653/v1/2023.findings-acl.896","title":"DEnsity: Open-domain Dialogue Evaluation Metric using Density Estimation","year":2023,"lang":"en","type":"article","venue":"","topic":"Topic Modeling","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"Kootenay Association for Science & Technology","funders":"Institute for Information and Communications Technology Promotion; Ministry of Science and ICT, South Korea; Korea Advanced Institute of Science and Technology","keywords":"Metric (unit); Computer science; Classifier (UML); Artificial intelligence; Feature vector; Feature (linguistics); Machine learning; Density estimation; Domain (mathematical analysis); Open domain; Pattern recognition (psychology); Mathematics; Statistics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002443153,0.00008723919,0.0001285186,0.0002924671,0.0001960743,0.000329161,0.0006374106,0.00005030438,0.00001592162],"category_scores_gemma":[0.000341994,0.00008494448,0.0000297974,0.001512749,0.00001075045,0.0008250945,0.0007523556,0.00006675689,0.0001760516],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001698449,"about_ca_system_score_gemma":0.0001509733,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0005150993,"about_ca_topic_score_gemma":0.0001147743,"domain_scores_codex":[0.998542,0.000162692,0.0002006878,0.0003757122,0.0004891488,0.000229765],"domain_scores_gemma":[0.9990883,0.0001071285,0.00007070097,0.0005127957,0.0001573614,0.00006369835],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000006684402,0.00006613656,0.004979145,0.00002461631,0.00003944498,0.00003805358,0.001541136,0.3930473,0.00567208,0.148605,0.001205946,0.4447744],"study_design_scores_gemma":[0.0002156417,0.000008256604,0.005571729,0.000006708735,0.000008967701,0.000008529207,0.0000189966,0.9439409,0.00125796,0.0488419,0.00001938287,0.000101031],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3659681,0.000005646602,0.6325253,0.0002884727,0.0003071963,0.0002332609,1.694119e-7,0.0001585681,0.0005131926],"genre_scores_gemma":[0.6514465,9.239815e-7,0.3483021,0.0001401935,0.0000331724,0.000006313713,0.000005816699,0.000004107379,0.00006089645],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.5508936,"threshold_uncertainty_score":0.3463935,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1344899496127179,"score_gpt":0.3537995330139125,"score_spread":0.2193095834011946,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}