{"id":"W4394896940","doi":"10.1109/tpds.2024.3390109","title":"Sampling-Based Multi-Job Placement for Heterogeneous Deep Learning Clusters","year":2024,"lang":"en","type":"article","venue":"IEEE Transactions on Parallel and Distributed Systems","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Victoria; University of Toronto; Memorial University of Newfoundland","funders":"British Columbia Knowledge Development Fund; Natural Sciences and Engineering Research Council of Canada; Canada Foundation for Innovation","keywords":"Computer science; Workload; Job scheduler; Scheduling (production processes); Distributed computing; Artificial intelligence; Machine learning; Latency (audio); Mathematical optimization; Computer network","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001484758,0.0007360349,0.0009151663,0.0004191773,0.001284253,0.000815767,0.002219338,0.0006503629,0.003106766],"category_scores_gemma":[0.003998194,0.0004389472,0.0004687923,0.0006298189,0.0007069235,0.001103744,0.001289626,0.001010168,0.0005457485],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001243649,"about_ca_system_score_gemma":0.002344985,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004169896,"about_ca_topic_score_gemma":0.007386882,"domain_scores_codex":[0.9991574,0.0001934238,0.00005772402,0.0002122413,0.0001651264,0.0002141009],"domain_scores_gemma":[0.9981864,0.0005796683,0.000167063,0.0004179832,0.0002940482,0.0003548166],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001104648,0.0005788264,0.004274349,0.0001726115,0.00007093543,0.0002119187,0.0002453408,0.8051181,0.0191242,0.009148265,0.007217685,0.1527332],"study_design_scores_gemma":[0.0000271861,0.00006113839,0.0002336361,0.000002550751,0.000004821788,0.00001458286,0.00003221542,0.9947032,0.002206495,0.002289292,0.0004189964,0.000005809578],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1963575,0.0004137531,0.7963958,0.0004388543,0.0001990189,0.0002936527,0.0001222436,0.002452009,0.003327107],"genre_scores_gemma":[0.8666369,0.00007931166,0.1311417,0.0001370763,0.00004399531,0.000163972,0.0001599035,0.0001407596,0.001496385],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004169896,"threshold_uncertainty_score":0.0103932,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03431295490472693,"score_gpt":0.2792646518185682,"score_spread":0.2449516969138412,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}