Traitement et compression de données en temps réel en utilisant l’intelligence artificielle pour des détecteurs à haut débit
Bibliographic record
Abstract
Le SLAC National Accelerator Laboratory démarrera bientôt la prochaine génération de lasers à électrons libres rayons X; le Linac Coherent Light Source - II (LCLS-II). Les expériences scientifiques rendues possibles par ce dernier conduisent à une génération de données qui dépassera le To/s. L’objectif global de la recherche proposée est de réduire la bande passante requise pour le transfert des données générées par les expériences qui auront lieu dans ces nouvelles installations. Pour ce faire, nous manipulons localement et en temps réel les données numériques rendues disponibles par un détecteur du SLAC National Accelerator Laboratory (la «CookieBox»), afin de compresser les données par discrimination événementielle. Cette compression rejette les données générées avec des impulsions de rayons X non conformes, ce qui diminue la bande passante globale. Les algorithmes existants ne permettent pas d’atteindre les requis en latence pour le traitement des données. En revanche, des algorithmes d’intelligence artificielle, comme le réseau de neurones artificiels, utilisent des opérations arithmétiques simples et parallélisables. Par conséquent, ces algorithmes démontrent le potentiel d’atteindre les requis en latence pour traiter les données générées par la «CookieBox». Malgré tout, la conception et l’utilisation d’algorithmes d’intelligence artificielle peuvent être incompatibles avec l’acquisition de données scientifiques en temps réel. Ainsi, ces travaux combinent des méthodes standards de compression de données avec les réseaux neuronaux. Cette approche permet d’atteindre la latence nécessaire pour la compression, en plus de minimiser l’empreinte matérielle nécessaire. Dans un premier temps, une méthode de quantification nonuniforme optimise la représentation de l’information à travers les données de la «CookieBox». La représentation plus dense permet de compresser les données en conservant les informations pertinentes qu’elles contiennent. Cela signifie que la taille des données est réduite sans perdre les informations importantes. Par la suite, un petit réseau neuronal utilise ces données afin de classifier les impulsions de rayons X en moins de 6 μs avec un taux de classification de 86 %. Il est possible d’atteindre une latence de moins de 2 μs en tolérant une baisse de 3 % sur le taux de classification. Les travaux de recherche proposés offrent une solution pour réduire la génération de données massives lors des expériences scientifiques de grande envergure tout en considérant les paradigmes liés à l’intelligence artificielle en science. La communauté scientifique pourra acquérir plus de données de meilleure qualité et les analyser plus rapidement, ce qui accélérera la recherche. Ces travaux auront des retombées directes sur la performance du détecteur visé, qui contribuera à la recherche fondamentale en structure des matériaux et des molécules biologiques. Plus encore, les outils de compression développés pourront être transférés à d’autres applications, par exemple en imagerie médicale et en informatique quantique.
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.001 | 0.006 |
| Meta-epidemiology (narrow) | 0.001 | 0.001 |
| Meta-epidemiology (broad) | 0.001 | 0.001 |
| Bibliometrics | 0.001 | 0.001 |
| Science and technology studies | 0.001 | 0.001 |
| Scholarly communication | 0.002 | 0.002 |
| Open science | 0.001 | 0.001 |
| Research integrity | 0.001 | 0.001 |
| Insufficient payload (model declined to judge) | 0.009 | 0.002 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".