{"id":"W4378505314","doi":"10.48550/arxiv.2305.15096","title":"Dynamic Masking Rate Schedules for MLM Pretraining","year":2023,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Speech Recognition and Synthesis","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Samsung; York University; Samsung Advanced Institute of Technology","keywords":"Masking (illustration); Computer science; Speedup; Transformer; Pareto principle; Schedule; Speech recognition; Real-time computing; Parallel computing; Mathematical optimization; Mathematics; Operating system; Engineering; Electrical engineering; Voltage","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001217233,0.001505903,0.000611107,0.0004002149,0.0004932668,0.0007164361,0.00157686,0.0008602885,0.008228865],"category_scores_gemma":[0.006266549,0.0007075621,0.0005807484,0.0002605086,0.0005402752,0.001869376,0.001360994,0.001961108,0.003065557],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008286135,"about_ca_system_score_gemma":0.001378504,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00455404,"about_ca_topic_score_gemma":0.01037209,"domain_scores_codex":[0.9995315,0.0001309726,0.000032985,0.0001324611,0.00009590908,0.00007618594],"domain_scores_gemma":[0.998054,0.001074153,0.0001155072,0.0004027588,0.0002469877,0.0001065268],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001532271,0.0004466851,0.004461857,0.0003149254,0.000119582,0.0002395175,0.0004438212,0.4698673,0.112495,0.006119905,0.009024256,0.3949349],"study_design_scores_gemma":[0.00007850187,0.0002538086,0.001022773,0.00003268322,0.00004099608,0.00007507707,0.00008516009,0.9545823,0.03574571,0.004573855,0.003469229,0.00003994659],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2092274,0.001190143,0.7593113,0.0007481663,0.0003646814,0.0002456832,0.0004761158,0.01871284,0.009723675],"genre_scores_gemma":[0.8174706,0.000214576,0.1748306,0.0003737347,0.00006549518,0.0002606298,0.0007823396,0.001504447,0.004497589],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.008228865,"threshold_uncertainty_score":0.02752829,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1660565028958392,"score_gpt":0.2201985164228235,"score_spread":0.05414201352698425,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}