{"id":"W4385572106","doi":"10.18653/v1/2023.semeval-1.7","title":"BERTastic at SemEval-2023 Task 3: Fine-Tuning Pretrained Multilingual Transformers Does Order Matter?","year":2023,"lang":"en","type":"article","venue":"","topic":"Topic Modeling","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Artificial Intelligence in Medicine (Canada)","funders":"","keywords":"Computer science; Transformer; Artificial intelligence; Fine-tuning; SemEval; Deep learning; Language model; Natural language processing; Machine learning; Framing (construction); Task (project management)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0003267987,0.000217597,0.0002059565,0.0001960407,0.0002022074,0.0001122758,0.0006626386,0.00008668387,0.0005227943],"category_scores_gemma":[0.00007982379,0.0001627631,0.00008864762,0.0007595015,0.00003837315,0.0003281367,0.0002666757,0.0001563562,0.001246038],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00006130629,"about_ca_system_score_gemma":0.00006767557,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001205947,"about_ca_topic_score_gemma":0.0004632775,"domain_scores_codex":[0.9980156,0.00004556838,0.0003502227,0.0006112644,0.0003880759,0.0005892643],"domain_scores_gemma":[0.9990361,0.0002287352,0.00004915203,0.0004749534,0.00007153823,0.0001395458],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001461019,0.000340677,0.02707188,0.001123301,0.0006327099,0.0006839494,0.06114306,0.09743448,0.1390691,0.01311421,0.04910679,0.6101337],"study_design_scores_gemma":[0.0005771359,0.00003117659,0.001299704,0.0000389086,0.0000118536,0.00001173234,0.0001576536,0.9912419,0.002605143,0.0005468788,0.003135896,0.0003420504],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3029455,0.00001889983,0.6835693,0.003626121,0.0009652966,0.0002958329,0.000009006919,0.0008706115,0.007699399],"genre_scores_gemma":[0.9267864,0.000007070273,0.03728484,0.0005997247,0.000116896,0.0000313909,0.00001882825,0.00003121266,0.03512365],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8938074,"threshold_uncertainty_score":0.9995316,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01810490949344891,"score_gpt":0.2628011679382798,"score_spread":0.2446962584448309,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}