Accélération de l'exploration de l'espace chimique du cytochrome P450 BM3 par des méthodes de criblage à haut débit et bio-informatiques
Bibliographic record
Abstract
L’application de la chimie organique est prépondérante dans plusieurs secteurs industriels tels que le pharmaceutique, le cosmétique, l’alimentaire ou les produits ménagers. La chimie organique évolue sans cesse pour rendre les synthèses plus efficaces et moins dispendieuses. Cependant, l’amélioration de voies de synthèse se fait souvent sans égard à leur effet sur l’environnement. Ceci a entrainé l’émergence de la chimie verte pour réduire leur impact environnemental. À cette fin, l’une des stratégies employées est la biocatalyse : l’utilisation d’enzymes due à leurs propriétés ‘vertes’ et leur grande efficacité réactionnelle. Les oxydases de type cytochrome P450 sont reconnues pour leur grande promiscuité, liée à leur rôle dans la détoxification de composés xénobiotiques et de molécules endogènes dans le corps. Cette superfamille d’enzymes accomplit une diversité de réactions d’oxydations en une seule étape telles que l’hydroxylation, l’époxidation, la désamination, la déshalogénation et la cyclopropanation. La P450 BM3 (P450 BM3) de Bacillus megaterium possède l’une des plus grandes activités catalytiques de sa famille, justifiant l’intérêt grandissant de ses applications industrielles. Ce mémoire se penche sur la nécessité d’améliorer les essais afin d’augmenter la capacité de criblage pour obtenir une plus grande proportion de variants capable de catalyser une réaction désirée. Il a été proposé que la synthèse de l’indigo par les variants de P450 BM3 soit un indicateur de promiscuité envers de nouveaux substrats. Nous avons exploré l’espace mutationnel de P450 BM3 pour la synthèse de l’indigo en comparant différentes méthodes de criblage de librairies de variants. Dans un premier temps, des librairies de variants furent créées par mutagénèse par saturation de site. Cela permet d’obtenir une représentation uniforme des variants à chaque position sélectionnée plus rapidement et à un coût modique. Ensuite, des méthodes de criblage furent optimisées pour quantifier les variants de P450 BM3 et les cribler de deux façons. Nous avons comparé un essai colorimétrique direct grâce à l’absorbance de l’indigo avec un essai général indirect combinant la fluorescence du cofacteur NADPH et la spectrométrie de masse (LC-MS, GC-MS et LC préparative). Cette deuxième approche permet de cribler les variants indépendamment du substrat. Afin d’augmenter le débit du criblage, nous avons optimisé les méthodes en utilisant des plaques 96 puits avec une station de pipetage automatisée. Nous avons découvert de multiples nouveaux variants de P450 BM3 synthétisant l’indigo dont une forte fraction de ces derniers s’est révélée aptes à synthétiser une molécule de valeur élevée en industrie : la cétone de framboise. La corrélation de l’activité de P450 BM3 avec l’indigo et la cétone de framboise justifie l’exploration plus profonde de l’espace mutationnel de P450 BM3. La compréhension de cette corrélation permettrait de guider d’avantage l’ingénierie de P450 BM3 vers de nouveaux substrats. À cette fin, nous tentons d’expliquer la relation entre la structure, le dynamisme et l’activité des variants de P450 BM3. Les méthodes de criblage conventionnelles ne sont pas assez efficaces pour générer de grandes séries de données (« Big Data »). Nous appliquons le séquençage de nouvelle génération afin d’identifier >104 variants simultanément pour relier le génotype (ADN) au phénotype (synthèse d’indigo). L’analyse de ces données nécessite l’utilisation d’outils statistiques et informatiques tels que la modélisation, la dynamique moléculaire et l’analyse de composantes indépendantes du temps et de la structure (tICA). Nous observons une tendance commune des variants actifs de P450 BM3 représenté par un changement d’équilibre entre ses deux conformations majeures. Ce changement conformationnel pourrait expliquer la propension de P450 BM3 à synthétiser l’indigo. Ce mémoire présente ainsi des méthodes permettant d’accélérer la découverte de variants actifs de P450 BM3 pour diverses réactions d’intérêt en industrie. Les méthodologies ci-développées pourront ensuite guider l’ingénierie d’autres systèmes enzymatiques.
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.001 | 0.001 |
| Meta-epidemiology (narrow) | 0.001 | 0.000 |
| Meta-epidemiology (broad) | 0.001 | 0.001 |
| Bibliometrics | 0.001 | 0.001 |
| Science and technology studies | 0.000 | 0.000 |
| Scholarly communication | 0.001 | 0.001 |
| Open science | 0.001 | 0.001 |
| Research integrity | 0.001 | 0.002 |
| Insufficient payload (model declined to judge) | 0.007 | 0.003 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".