{"id":"W3197317199","doi":"10.18653/v1/2022.starsem-1.16","title":"A Generative Approach for Mitigating Structural Biases in Natural Language Inference","year":2022,"lang":"en","type":"preprint","venue":"","topic":"Topic Modeling","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Azrieli Foundation","keywords":"Discriminative model; Generative grammar; Computer science; Generative model; Inference; Artificial intelligence; Task (project management); Machine learning; Context (archaeology); Pattern recognition (psychology)","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008525584,0.001560054,0.001616128,0.001505404,0.001046146,0.001737693,0.003196412,0.002234191,0.002720986],"category_scores_gemma":[0.03312495,0.001479665,0.001798794,0.001401083,0.00278015,0.003930483,0.004632578,0.004767451,0.001135008],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001732098,"about_ca_system_score_gemma":0.002179517,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003110722,"about_ca_topic_score_gemma":0.007249512,"domain_scores_codex":[0.994582,0.003018235,0.0002135483,0.001018108,0.0008903865,0.0002777519],"domain_scores_gemma":[0.9788406,0.01469282,0.0008859103,0.00431903,0.0009192094,0.0003424608],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0004242034,0.0003194586,0.009364375,0.0003503394,0.0004085423,0.0003381042,0.00106449,0.59065,0.01466513,0.1868818,0.007067489,0.188466],"study_design_scores_gemma":[0.00003208609,0.00004705707,0.0004102135,0.00002763236,0.00004308085,0.0001075449,0.00002054599,0.9068085,0.002907907,0.08799616,0.001577331,0.00002189693],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01096996,0.0002762296,0.9859779,0.0004560395,0.00002956396,0.00006196272,0.0001030495,0.001059185,0.001066122],"genre_scores_gemma":[0.6067366,0.0005773754,0.3846725,0.001640298,0.0003280615,0.0004996224,0.001090205,0.0008494901,0.003605763],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.008525584,"threshold_uncertainty_score":0.04508811,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06508462960440754,"score_gpt":0.3299257838038966,"score_spread":0.2648411541994891,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}