{"id":"W4408846465","doi":"10.1145/3689031.3717461","title":"Mist: Efficient Distributed Training of Large Language Models via Memory-Parallelism Co-Optimization","year":2025,"lang":"en","type":"article","venue":"","topic":"Topic Modeling","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"Vector Institute; University of Toronto","funders":"","keywords":"Computer science; Mist; Parallel computing; Parallelism (grammar); Training (meteorology); Computer architecture; Distributed computing","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0002852241,0.0001041538,0.0001757102,0.0001018679,0.00007098579,0.00004098617,0.0004979891,0.00006061687,0.0000403236],"category_scores_gemma":[0.00002774693,0.00009699356,0.00005790456,0.0002959118,0.00001738937,0.0001337994,0.0001380133,0.00007802928,0.000003142971],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00003750133,"about_ca_system_score_gemma":0.00006822145,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00004975488,"about_ca_topic_score_gemma":0.000005720179,"domain_scores_codex":[0.9989343,0.00004156708,0.0002891903,0.0002939985,0.0002049575,0.0002360037],"domain_scores_gemma":[0.9992857,0.00005087698,0.00007116673,0.0004753567,0.00007033609,0.00004656481],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000002205888,0.00004259171,0.000006068286,0.000016333,0.00001018631,0.000002694944,0.002157433,0.9438673,0.0003265163,0.04954378,0.0001325321,0.00389234],"study_design_scores_gemma":[0.0004176843,0.000007591524,0.00001671325,0.00002147221,0.000005311919,0.000001400036,0.000252387,0.9963229,0.002044526,0.0007641703,0.00005539983,0.00009047301],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.009041126,0.00009173528,0.9790273,0.0004069775,0.0001421191,0.0001413037,0.00001183979,0.0001640676,0.0109735],"genre_scores_gemma":[0.8568979,0.000001873773,0.1422982,0.0002327492,0.00001368748,0.000006138662,0.00002329429,0.000003998556,0.0005222021],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.8478568,"threshold_uncertainty_score":0.3955283,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0171281055888019,"score_gpt":0.2690719334659288,"score_spread":0.2519438278771269,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}