{"id":"W3197317199","doi":"10.18653/v1/2022.starsem-1.16","title":"A Generative Approach for Mitigating Structural Biases in Natural Language Inference","year":2022,"lang":"en","type":"preprint","venue":"","topic":"Topic Modeling","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Azrieli Foundation","keywords":"Discriminative model; Generative grammar; Computer science; Generative model; Inference; Artificial intelligence; Task (project management); Machine learning; Context (archaeology); Pattern recognition (psychology)","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0002878174,0.0002375405,0.0002935622,0.0001593875,0.0001116967,0.0002453544,0.001330295,0.00009575114,0.00003241285],"category_scores_gemma":[0.0003016962,0.0002137666,0.0001056344,0.0001689304,0.00002245023,0.0001928802,0.002610315,0.0007191836,4.006009e-7],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000159395,"about_ca_system_score_gemma":0.0002249761,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0005727267,"about_ca_topic_score_gemma":0.0001178865,"domain_scores_codex":[0.998126,0.0001120714,0.0003365783,0.0008128624,0.0002643096,0.0003481395],"domain_scores_gemma":[0.9988496,0.0002706078,0.0001451461,0.0006340028,0.00005196856,0.00004868368],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00001074233,0.00004783269,0.002202758,0.0003573958,0.00006496481,0.00003264993,0.02947735,0.8276044,0.001044165,0.06905591,0.0001297424,0.06997205],"study_design_scores_gemma":[0.0001928974,0.00001333333,0.0002649504,0.00002899686,0.000002752206,0.000003489182,0.0006826404,0.9951361,0.0005590975,0.002838019,0.00000703054,0.0002706352],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2853294,0.0004994501,0.7116655,0.0001695032,0.0005679417,0.000619728,0.00002127652,0.0001540138,0.000973131],"genre_scores_gemma":[0.5474674,0.000001201434,0.451803,0.0001619983,0.00008137541,0.0002021798,0.00007028865,0.000006858869,0.0002056617],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.262138,"threshold_uncertainty_score":0.8717151,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06508462960440754,"score_gpt":0.3299257838038966,"score_spread":0.2648411541994891,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}