Estimation de paramètres en exploitant les aspects calculatoires et numériques
Notice bibliographique
Résumé
Dans cette thèse, nous nous intéressons principalement à l’estimation de paramètres. Elle est constituée de trois articles dans lesquels nous abordons des problèmes d’estimation dans des modèles précis. Dans le premier article, nous considérons la famille paramétrique de copules de Farlie-Gumbel-Morgenstern. Les observations proviennent d’une loi qui fait intervenir à la fois la copule et les marges, au travers de la décomposition du théorème de Sklar. Les marges sont inconnues. Dans le cadre de l’estimation d’une fonction du paramètre de la copule, la pseudo-vraisemblance est souvent utilisée en lieu et place de la vraisemblance. C’est une approche qui va généralement produire des estimateurs non efficaces (variance non-minimale), spécialement pour de petites tailles d’échantillons. Dans la pseudo-vraisemblance, les marges sont remplacées par des estimateurs qui dépendent des rangs. Nous proposons d’utiliser la vraisemblance des rangs, qui est la vraisemblance basée sur la distribution de la statistique des rangs. Cette approche peut être complexe en pratique car on doit travailler sur le groupe des permutations et on doit calculer des intégrales multiples. Néanmoins, il est possible d’effectuer les calculs pour la famille de copules de Farlie-Gumbel-Morgenstern. Nous comparons les estimateurs obtenus de ces approches à l’aide de la méthode bayésienne. Les résultats des études numériques sont présentés. Certains estimateurs rencontrés dans la littérature sont des rapports de variables aléatoires de lois normales. Dans le second article, nous nous intéressons à la distribution du rapport de deux variables aléatoires de lois normales. Plusieurs auteurs ont abordé ce sujet. La nouvelle paramétrisation que nous introduisons nous permet d’arriver assez facilement à de nouveaux résultats. Tout d’abord, nous montrons que l’expression de la densité du rapport s’écrit comme un mélange de densités appartenant à une nouvelle famille que nous créons. Nous proposons quelques propriétés et nous donnons l’expression analytique de la fonction caractéristique pour la nouvelle famille. Cette nouvelle famille est en fait une généralisation de la famille des densités des lois de Student de degrés de liberté impairs. Nous arrivons à des résultats de convergence similaires à la convergence observée des lois de Student lorsque le degré de liberté tend vers l’infini. Des résultats semblables de convergence ainsi que quelques propriétés sont développées pour la loi du rapport. Nous utilisons une approche bayésienne pour estimer le rapport de deux moyennes de variables aléatoires de lois normales. Des illustrations graphiques et des résultats des simulations sont présentés. Dans le troisième sujet, nous étendons la famille de distributions issue de la différence de deux variables aléatoires indépendantes de loi gamma, en considérant le cas où ces variables aléatoires sont positivement corrélées. Les densités de cette famille sont trouvées. La forme complexe de ces densités rend fastidieuses les méthodes d’estimation basées sur la vraisemblance. La méthode d’estimation basée sur la fonction caractéristique est utilisée, et l’approche continue est comparée à l’approche discrète. Par ailleurs, nous aboutissons à deux algorithmes simples permettant de générer facilement des données de deux variables aléatoires positivement corrélées et identiquement distribuées de loi gamma. Le meilleur estimateur équivariant pour le paramètre d’échelle est obtenu dans le cas de l’indépendance.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,002 | 0,014 |
| Méta-épidémiologie (sens strict) | 0,001 | 0,001 |
| Méta-épidémiologie (sens large) | 0,001 | 0,002 |
| Bibliométrie | 0,002 | 0,002 |
| Études des sciences et des technologies | 0,001 | 0,001 |
| Communication savante | 0,003 | 0,003 |
| Science ouverte | 0,001 | 0,001 |
| Intégrité de la recherche | 0,001 | 0,002 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,006 | 0,002 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».