{"id":"W7133031893","doi":"","title":"Mist: Co-Optimize Memory Optimizations with Parallelism for Large Scale Distributed Training","year":2024,"lang":"","type":"dissertation","venue":"TSpace","topic":"Parallel Computing and Optimization Techniques","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"University of Toronto","keywords":"Pipeline (software); Schedule; Speedup; Parallelism (grammar); Distributed memory; Key (lock); Scale (ratio); Integer programming","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","sts","scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.0009948253,0.001232032,0.001294562,0.0005956551,0.001412728,0.001482766,0.001764035,0.000816273,0.0001795963],"category_scores_gemma":[0.0001776915,0.001213883,0.0005322023,0.001560307,0.0001484001,0.0004780951,0.0001922224,0.0009860945,0.00007761641],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002471068,"about_ca_system_score_gemma":0.001294464,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00005879007,"about_ca_topic_score_gemma":0.00005740998,"domain_scores_codex":[0.9940905,0.0002336477,0.001140355,0.002184,0.0008681871,0.001483303],"domain_scores_gemma":[0.9957594,0.000489036,0.0008543083,0.001391728,0.001005722,0.0004997626],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0004253782,0.0004861295,0.00001182159,0.001103171,0.0005546553,0.00006653689,0.1178082,0.8229828,0.00007789794,0.006860064,0.04646812,0.00315518],"study_design_scores_gemma":[0.001869917,0.0004558948,0.00002546376,0.001258438,0.0003877529,0.00004961774,0.009770635,0.9672287,0.001138773,0.0005191607,0.01570681,0.001588889],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.000785077,0.001405715,0.9821322,0.0016788,0.001144763,0.002280464,0.000409618,0.001966779,0.008196562],"genre_scores_gemma":[0.03452808,0.0005488871,0.9000748,0.0004285094,0.0005367284,0.0009738986,0.01037514,0.0003248037,0.05220916],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.1442458,"threshold_uncertainty_score":0.9998873,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02881691282966678,"score_gpt":0.3375832647109168,"score_spread":0.30876635188125,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}