Intelligent prefetching and caching for scientific data mining in the middleware GAMine.
Notice bibliographique
Résumé
Scientific data mining applications are widespread in different scientific fields. They are composed of huge datasets, complicated algorithms and often deployed on high performance parallel platforms. Especially, the increasingly large-scale data sets cause the data access to be the most time-consuming stage of the overall execution time. Caching and prefetching can be used to enhance the efficiency of data access to improve the applications' performance. Traditional OS's file system's caching and prefetching strategies as well other enhanced approaches ignore the applications' runtime situation. As a result, not all data retrieval latency can be hidden, or cache units have to be larger if data access is remote. The first step of our approach is to build a middleware---GAMine, which is independent of data sets and applications and provides a generic data access optimization strategy for scientific data mining applications. It supports both client/server and peer-to-peer architectures, and has a flexible, symmetric design. Secondly, within our GAMine, the prefetching strategy exploits the knowledge of access patterns and system parameters (latency and throughput) to set the preferred prefetch depth. In addition, GAMine can be told to select different caching policies according to different access patterns and architectures. As a result, the middleware can hide more latency and avoid cache pollution. Finally, GAMine can monitor the data consumption rate and the data delivery rate to set the prefetch depth dynamically to the optimal value as regards latency hiding and the cache size. Thus even in the dynamic situation, the latency can still be hidden at anytime due to the middleware's adaptation. Paper copy at Leddy Library: Theses & Major Papers - Basement, West Bldg. / Call Number: Thesis2004 .H8. Source: Masters Abstracts International, Volume: 44-01, page: 0393. Thesis (M.Sc.)--University of Windsor (Canada), 2005.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,002 | 0,004 |
| Méta-épidémiologie (sens strict) | 0,001 | 0,001 |
| Méta-épidémiologie (sens large) | 0,001 | 0,001 |
| Bibliométrie | 0,001 | 0,001 |
| Études des sciences et des technologies | 0,001 | 0,001 |
| Communication savante | 0,002 | 0,003 |
| Science ouverte | 0,003 | 0,002 |
| Intégrité de la recherche | 0,001 | 0,001 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,001 | 0,001 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».