{"id":"W7104018988","doi":"10.18419/opus-17489","title":"Can BERT generate Quebec English? : exploring and improving the acceptability of regional variation in pretrained language models","year":2024,"lang":"en","type":"other","venue":"OPUS Publication Server of the University of Stuttgart (University of Stuttgart)","topic":"","field":"","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Variety (cybernetics); Language model; Variation (astronomy); Sentence; Natural language; Natural (archaeology); Sentence processing; On Language","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.001222763,0.0004017709,0.0008182549,0.0009264091,0.0002186481,0.00003132288,0.001698232,0.0003653495,0.000812951],"category_scores_gemma":[0.000130437,0.0004072894,0.0003681656,0.00137563,0.001123614,0.00105283,0.001215654,0.0004831431,0.00001089041],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000487847,"about_ca_system_score_gemma":0.0004780392,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_topic_score_codex":0.1228392,"about_ca_topic_score_gemma":0.08514103,"domain_scores_codex":[0.9970852,0.00044614,0.0004566753,0.0007791368,0.000883319,0.0003495324],"domain_scores_gemma":[0.9958884,0.0001320032,0.001591982,0.00141678,0.0008561549,0.0001147024],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"observational","study_design_scores_codex":[0.001925407,0.002493381,0.01282006,0.008354933,0.004758542,0.00002810954,0.6434609,0.003178632,0.0170913,0.05781505,0.2312048,0.0168689],"study_design_scores_gemma":[0.01428379,0.0005345715,0.4945206,0.002784665,0.004233088,0.0000153703,0.3079918,0.02478737,0.001981794,0.002574638,0.1428686,0.003423658],"study_design_candidate":"qualitative","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9002774,0.001194022,0.0005736048,0.004314141,0.0005405049,0.003696399,0.002927867,0.0003727979,0.0861033],"genre_scores_gemma":[0.9063623,0.0002037421,0.001566457,0.0000212661,0.00006395519,0.000001242769,0.0001844308,0.0001836432,0.09141297],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.4817006,"threshold_uncertainty_score":0.9998379,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02542285309277387,"score_gpt":0.1921105521303376,"score_spread":0.1666876990375637,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}