Speech based natural language profile before, during and after the onset of psychosis: A cluster analysis
Notice bibliographique
Résumé
BACKGROUND AND HYPOTHESIS: Speech markers are digitally acquired, computationally derived, quantifiable set of measures that reflect the state of neurocognitive processes relevant for social functioning. "Oddities" in language and communication have historically been seen as a core feature of schizophrenia. The application of natural language processing (NLP) to speech samples can elucidate even the most subtle deviations in language. We aim to determine if NLP based profiles that are distinctive of schizophrenia can be observed across the various clinical phases of psychosis. DESIGN: Our sample consisted of 147 participants and included 39 healthy controls (HC), 72 with first-episode psychosis (FEP), 18 in a clinical high-risk state (CHR), 18 with schizophrenia (SZ). A structured task elicited 3 minutes of speech, which was then transformed into quantitative measures on 12 linguistic variables (lexical, syntactic, and semantic). Cluster analysis that leveraged healthy variations was then applied to determine language-based subgroups. RESULTS: We observed a three-cluster solution. The largest cluster included most HC and the majority of patients, indicating a 'typical linguistic profile (TLP)'. One of the atypical clusters had notably high semantic similarity in word choices with less perceptual words, lower cohesion and analytical structure; this cluster was almost entirely composed of patients in early stages of psychosis (EPP - early phase profile). The second atypical cluster had more patients with established schizophrenia (SPP - stable phase profile), with more perceptual but less cognitive/emotional word classes, simpler syntactic structure, and a lack of sufficient reference to prior information (reduced givenness). CONCLUSION: The patterns of speech deviations in early and established stages of schizophrenia are distinguishable from each other and detectable when lexical, semantic and syntactic aspects are assessed in the pursuit of 'formal thought disorder'.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,001 | 0,003 |
| Méta-épidémiologie (sens strict) | 0,000 | 0,000 |
| Méta-épidémiologie (sens large) | 0,000 | 0,001 |
| Bibliométrie | 0,002 | 0,001 |
| Études des sciences et des technologies | 0,001 | 0,000 |
| Communication savante | 0,001 | 0,000 |
| Science ouverte | 0,000 | 0,001 |
| Intégrité de la recherche | 0,000 | 0,000 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,002 | 0,000 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».