{"id":"W3212619741","doi":"10.18653/v1/2021.eval4nlp-1.6","title":"Trainable Ranking Models to Evaluate the Semantic Accuracy of Data-to-Text Neural Generator","year":2021,"lang":"en","type":"article","venue":"","topic":"Topic Modeling","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université Laval","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Metric (unit); Ranking (information retrieval); Generalization; Generator (circuit theory); Table (database); Artificial intelligence; Inference; Embedding; Natural language processing; Artificial neural network; Machine learning; Data mining; Mathematics","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0007801843,0.0001166139,0.0001819104,0.00005290152,0.0001190675,0.0002086661,0.002108989,0.00002577031,0.00005598956],"category_scores_gemma":[0.0001424639,0.00008170403,0.0000432264,0.0005054656,0.00001068854,0.0008498805,0.001653918,0.00009143908,0.00003181506],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00001923804,"about_ca_system_score_gemma":0.0001893306,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001364643,"about_ca_topic_score_gemma":0.00007242004,"domain_scores_codex":[0.9982774,0.0001282742,0.0002991157,0.0005593994,0.0004281963,0.0003076532],"domain_scores_gemma":[0.9974507,0.0001649783,0.00003771721,0.002050711,0.0001973762,0.00009851796],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000007042028,0.00005653507,0.0000243788,0.00004265129,0.00004379173,0.00003923149,0.005490365,0.7093797,0.03262598,0.08474483,0.00323457,0.1643109],"study_design_scores_gemma":[0.0001522566,0.00001357729,0.00003263756,0.00001453882,0.000009458224,0.00001396542,0.00009691933,0.9899657,0.006073911,0.002799946,0.0007174336,0.0001096488],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1451765,0.0001193694,0.8464078,0.007061724,0.0002209771,0.0002105535,0.000002836263,0.00005299362,0.0007472042],"genre_scores_gemma":[0.8445762,0.000003597702,0.1517589,0.003030313,0.00008091811,0.00001058177,0.000002358082,0.000008101631,0.0005290935],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.6993996,"threshold_uncertainty_score":0.3919061,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1835300828757242,"score_gpt":0.339522803652108,"score_spread":0.1559927207763838,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}