TIAS: Two-level Information-Agnostic Job Scheduling in GPU Clusters
Notice bibliographique
Résumé
In recent years, deep learning algorithms have shown a trend towards larger models and larger datasets. Centralized training is unable keep up with the training requirements due to limited storage and computing resources, thus distributed learning is becoming an important area of research for improving learning efficiency. There are many studies on using the features of deep learning workload to design a central scheduler for production clusters.While existing work has been focusing on overall completion time and resource efficiency, little attention has been paid to the execution deadlines. To achieve a balance between the goals of deadline and non-deadline jobs, we design a Two-level Information-Agnostic Scheduling strategy(TIAS), which can schedule the two kinds of jobs together without knowing jobs’ training duration. In the first level, we use different priority calculation methods for the two kinds of jobs; in the second level, we design a new indicator "queue urgency" based on three observations to sort deadline jobs within the same queue. Experiments on a trace-driven simulator prove that TIAS can achieve the best trade-off between deadline miss rate and non-deadline jobs’ average job completion time(JCT) compared to existing solutions.
Conservé avec la notice de tri, où il sert de preuve aux étiquettes ci-dessus.
Comment cette classification a été obtenuedéplier
Le tri à trois modèles
les 5 600 travaux triés →Les trois modèles l'ont jugé hors champ.
GPU cluster job scheduling algorithm for deep learning workloads; a computer systems contribution, not a study of research.
The work studies GPU job scheduling for machine-learning workloads, not research as a system or practice.
Systems paper on GPU-cluster job scheduling for deep learning workloads, not study of research practice.
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,002 | 0,004 |
| Méta-épidémiologie (sens strict) | 0,001 | 0,001 |
| Méta-épidémiologie (sens large) | 0,001 | 0,000 |
| Bibliométrie | 0,001 | 0,001 |
| Études des sciences et des technologies | 0,001 | 0,001 |
| Communication savante | 0,001 | 0,001 |
| Science ouverte | 0,004 | 0,002 |
| Intégrité de la recherche | 0,001 | 0,001 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,003 | 0,001 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».