{"id":"W4378418331","doi":"10.18280/ria.370219","title":"BalBERT: A New Approach to Improving Dataset Balancing for Text Classification","year":2023,"lang":"en","type":"article","venue":"Revue d intelligence artificielle","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Computer science; Natural language processing; Information retrieval; Artificial intelligence","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007974909,0.002572859,0.002183537,0.006645559,0.002256808,0.003721021,0.005219638,0.002640044,0.006208488],"category_scores_gemma":[0.02981559,0.0008250633,0.001645006,0.005501163,0.000967068,0.01000811,0.00515066,0.003159887,0.00609471],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001499885,"about_ca_system_score_gemma":0.002155946,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003493418,"about_ca_topic_score_gemma":0.005699572,"domain_scores_codex":[0.9924341,0.001798296,0.0008504137,0.001758174,0.002709971,0.0004490411],"domain_scores_gemma":[0.9876475,0.003718177,0.001268725,0.003677732,0.003154712,0.0005330736],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001306144,0.0008793591,0.006070252,0.0003717671,0.000192011,0.0001857201,0.0004671827,0.01527846,0.03188128,0.006043323,0.03960365,0.8977209],"study_design_scores_gemma":[0.0006239035,0.001627521,0.007482313,0.000189784,0.0002561047,0.0007362002,0.0009773035,0.8235673,0.0465978,0.03401421,0.08370413,0.000223377],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.06207111,0.00227039,0.8907954,0.001448768,0.00190718,0.001881666,0.00352839,0.02863062,0.00746651],"genre_scores_gemma":[0.2458025,0.0007087886,0.7080324,0.001562057,0.002011756,0.002406596,0.01975752,0.001821106,0.01789729],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.007974909,"threshold_uncertainty_score":0.04217583,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.09182440662175224,"score_gpt":0.3138121450268641,"score_spread":0.2219877384051118,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}