{"id":"W3154584133","doi":"10.48550/arxiv.2104.06335","title":"On the Use of Linguistic Features for the Evaluation of Generative Dialogue Systems","year":2021,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Topic Modeling","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Generalization; Computer science; Relevance (law); Task (project management); Metric (unit); Proposition; Generative grammar; Natural language processing; Artificial intelligence; Measure (data warehouse); Generative model; Machine learning; Linguistics; Mathematics; Data mining","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0007911128,0.0001347257,0.0002103211,0.00007154975,0.0001074852,0.00008787472,0.0009734516,0.0001102143,0.00000292199],"category_scores_gemma":[0.0008876676,0.00009285519,0.0001505721,0.0001911065,0.00006714684,0.0000678838,0.0005268932,0.0002212894,5.085394e-7],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00009632459,"about_ca_system_score_gemma":0.0002995211,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0004416892,"about_ca_topic_score_gemma":0.00008569101,"domain_scores_codex":[0.9986726,0.0004097366,0.0001743662,0.0004479221,0.0001813409,0.0001140076],"domain_scores_gemma":[0.9961277,0.001454209,0.0003291854,0.001158619,0.0009073126,0.00002303539],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00000610775,0.00001558513,0.00002517886,0.00003168367,0.00006777125,0.00000189432,0.0007469391,0.692104,0.00002357833,0.3067158,0.00006948411,0.0001919053],"study_design_scores_gemma":[0.0001586422,0.00002338641,0.0002182896,0.0001253617,0.0001475662,4.782963e-7,0.0001103758,0.9834785,0.0003081924,0.01530288,0.00003765777,0.00008862893],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1832448,0.000204336,0.8146604,0.00008917983,0.0009581566,0.0007037907,0.00001795302,0.0000151841,0.0001062438],"genre_scores_gemma":[0.9982825,0.00003798773,0.00136566,0.00003924761,0.00008690603,0.000005553798,0.000008561339,0.000006072823,0.0001675337],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8150377,"threshold_uncertainty_score":0.3786525,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3171293089957628,"score_gpt":0.2439817698250702,"score_spread":0.07314753917069264,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}