{"id":"W3212619741","doi":"10.18653/v1/2021.eval4nlp-1.6","title":"Trainable Ranking Models to Evaluate the Semantic Accuracy of Data-to-Text Neural Generator","year":2021,"lang":"en","type":"article","venue":"","topic":"Topic Modeling","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université Laval","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Metric (unit); Ranking (information retrieval); Generalization; Generator (circuit theory); Table (database); Artificial intelligence; Inference; Embedding; Natural language processing; Artificial neural network; Machine learning; Data mining; Mathematics","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01218647,0.002748758,0.001185062,0.003451145,0.000737509,0.002270191,0.00259497,0.002787859,0.003409488],"category_scores_gemma":[0.05294822,0.0003827452,0.001114558,0.002184704,0.001455098,0.004668717,0.002460151,0.002827056,0.00222144],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001590784,"about_ca_system_score_gemma":0.001399255,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003658968,"about_ca_topic_score_gemma":0.005265119,"domain_scores_codex":[0.9928365,0.003408523,0.0005731297,0.00132982,0.001516836,0.000335228],"domain_scores_gemma":[0.9731736,0.01826717,0.001245448,0.004275791,0.00253127,0.0005067193],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001058908,0.0006330718,0.02160963,0.00128947,0.0008432943,0.0004265743,0.0004240324,0.3792263,0.01349351,0.01005295,0.02582309,0.5451192],"study_design_scores_gemma":[0.00006374966,0.0004171617,0.003339995,0.00005393507,0.00009512615,0.0002186092,0.0001565568,0.9651441,0.01544782,0.01164575,0.00336453,0.00005257846],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.2072969,0.004116499,0.7452681,0.00163119,0.0008386048,0.0007510301,0.007273551,0.02106534,0.01175878],"genre_scores_gemma":[0.7975559,0.0005804322,0.1750377,0.000574566,0.0002290266,0.0005716578,0.01998764,0.001221053,0.004241984],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01218647,"threshold_uncertainty_score":0.06444895,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1835300828757242,"score_gpt":0.339522803652108,"score_spread":0.1559927207763838,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}