MétaCan
Menu
Back to cohort
Record W7009593967

Évaluation d’Apache Ozone et de son intégration du protocole de consensus RAFT avec la librairie Apache Ratis afin d'obtenir un système distribué fiable et cohérent

2024· article· fr· W7009593967 on OpenAlexaff

Bibliographic record

VenueR-libre (Université Téluq) · 2024
Typearticle
Languagefr
FieldDecision Sciences
TopicData Quality and Management
Canadian institutionsUniversité de Saint-Boniface
Fundersnot available
KeywordsEnvironmental policyAir pollutants
DOInot available

Abstract

fetched live from OpenAlex

De nos jours, l’utilisation de systèmes distribués est monnaie courante. Traditionnellement, l’entreprise utilisait l’entrepôt de données (data warehouse), lequel utilisait la méthodologie « schema on write » pour emmagasiner l’information dans une structure de données robuste et optimisée. Par contre, cette rigidité la rendait difficile à modifier comparativement à celle du « schema on read » (Sebaa et al., 2017), telle qu’utilisée dans les lacs de données (data lake), terme inventé en 2010 par James Dixon, fondateur de la compagnie Pentaho. Ce dernier représente un environnement distribué qui permet de stocker et traiter une quantité phénoménale de données brutes non structurées, semi-structurées ou structurées. Ces dernières sont ensuite ingérées massivement et rapidement sans aucun processus de transformation intermédiaire (Extract, Transform and Load) car différentes structures de données seront appliquées uniquement lorsqu’elles seront utilisées (Extract, Load and Transform), pour y effectuer des analyses qui permettront à l’organisation de prendre des décisions éclairées pour assurer sa pé- rennité (Madera & Laurent, 2016). Relativement peu coûteux, ils permettent de relier plusieurs machines entre elles afin de former une grappe (cluster) qui permettra notamment de répartir la charge et de répliquer les données afin d’obtenir un environnement doté de haute disponibilité (Nachiappan, 2020). L’un des problèmes communs est de conserver la cohérence entre les réplications lors d’erreurs ou d’échecs (J.-S. Ahn et al., 2019). Parmi ces systèmes distribués, nous retrouvons un récent projet débuté en 2018 par la Apache Software Foundation (ASF) et nommé Apache Ozone (Ozone), dont la première version officiellement disponible au grand public est parue en septembre 2020 (Ozone, 2023). Ce produit possède plusieurs particularités dont celle de pouvoir gérer efficacement les petits fichiers, contrairement à Apache Hadoop (Hadoop) pour lequel c’est une problématique (Bende & Shedge, 2016), tout en étant hautement extensible (Mehmood et al., 2024). De plus, il intègre un autre logiciel de ASF, Apache Ratis (Ratis), qui est une implémentation Java du protocole de consensus Replicated And Fault Tolerant (RAFT), similaire à Paxos et Viewstamped Replication, basés eux aussi sur l’élection d’un leader (Liu, 2018), permettant la tolérance aux pannes grâce à ses processus de validation, d’entente et de réplication d’une même valeur entre toutes les machines (Ongaro & Ousterhout, 2014), offrant ainsi une excellente redondance. Le choix de RAFT n’est probablement pas le fruit du hasard, car ce dernier a su se forger une solide communauté ayant développé des versions dans une panoplie de langages notamment C++, Python et Java (Howard, 2014) et il est utilisé dans différents systèmes tels que etcd, CockroachDB et neo4j pour ne nommer que ceux-ci. Une chose est certaine, c’est que les pannes font déjà partie du quotidien et que les systèmes doivent être en mesure de les gérer tout en demeurant cohérents. Notre projet de recherche consiste donc à bâtir une infrastructure Ozone afin de pouvoir vérifier la fiabilité et mesurer la cohérence entre les différents noeuds (nodes) composant ce que nous appelons le RAFT cluster. Nous allons utiliser une méthodologie basée sur l’expérience et les simulations afin de produire nos résultats et valider notre hypothèse.

Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.

How this classification was reachedexpand

Full frame distilled prediction

Teacher imitation

Not calibrated prevalence, not ground truth. Human validation pending. Learned from the 10,348 direct Codex labels and 10,348 direct Gemma labels. Candidate is the union of thresholded teacher heads; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels or direct frontier model labels.

metaresearch head score (Codex)0.010
metaresearch head score (Gemma)0.001
Version: codex-gemma-dda1882f352aValidation status: machine_predicted_unvalidated
Candidate categoriesMeta-epidemiology (narrow), Scholarly communication, Insufficient payload (model declined to judge)
Consensus categoriesnone
DomainCandidate signal: none · Consensus signal: none
Study designCandidate signal: Not applicable · Consensus signal: none
GenreCandidate signal: Empirical · Consensus signal: none
Teacher disagreement score0.646
Threshold uncertainty score1.000

Codex and Gemma teacher scores by category

CategoryCodexGemma
Metaresearch0.0100.001
Meta-epidemiology (narrow)0.0000.000
Meta-epidemiology (broad)0.0010.000
Bibliometrics0.0000.002
Science and technology studies0.0010.000
Scholarly communication0.0020.002
Open science0.0010.001
Research integrity0.0000.001
Insufficient payload (model declined to judge)0.0020.001

Machine scores (provisional)

The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.

Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.

Opus teacher head0.055
GPT teacher head0.331
Teacher spread0.276 · how far apart the two teachers sit on this one work
Validation statusscore_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from it

Classification

machine, unvalidated

Machine predicted; a candidate call from one teacher head, not a consensus.

Study designNot applicable
Domainnot available
GenreEmpirical

How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".

Quick stats

Citations0
Published2024
Admission routes1
Has abstractyes

Explore more

Same venueR-libre (Université Téluq)Same topicData Quality and ManagementFrench-language works237,207