Estimation de paramètres en exploitant les aspects calculatoires et numériques
Bibliographic record
Abstract
Dans cette thèse, nous nous intéressons principalement à l’estimation de paramètres. Elle est constituée de trois articles dans lesquels nous abordons des problèmes d’estimation dans des modèles précis. Dans le premier article, nous considérons la famille paramétrique de copules de Farlie-Gumbel-Morgenstern. Les observations proviennent d’une loi qui fait intervenir à la fois la copule et les marges, au travers de la décomposition du théorème de Sklar. Les marges sont inconnues. Dans le cadre de l’estimation d’une fonction du paramètre de la copule, la pseudo-vraisemblance est souvent utilisée en lieu et place de la vraisemblance. C’est une approche qui va généralement produire des estimateurs non efficaces (variance non-minimale), spécialement pour de petites tailles d’échantillons. Dans la pseudo-vraisemblance, les marges sont remplacées par des estimateurs qui dépendent des rangs. Nous proposons d’utiliser la vraisemblance des rangs, qui est la vraisemblance basée sur la distribution de la statistique des rangs. Cette approche peut être complexe en pratique car on doit travailler sur le groupe des permutations et on doit calculer des intégrales multiples. Néanmoins, il est possible d’effectuer les calculs pour la famille de copules de Farlie-Gumbel-Morgenstern. Nous comparons les estimateurs obtenus de ces approches à l’aide de la méthode bayésienne. Les résultats des études numériques sont présentés. Certains estimateurs rencontrés dans la littérature sont des rapports de variables aléatoires de lois normales. Dans le second article, nous nous intéressons à la distribution du rapport de deux variables aléatoires de lois normales. Plusieurs auteurs ont abordé ce sujet. La nouvelle paramétrisation que nous introduisons nous permet d’arriver assez facilement à de nouveaux résultats. Tout d’abord, nous montrons que l’expression de la densité du rapport s’écrit comme un mélange de densités appartenant à une nouvelle famille que nous créons. Nous proposons quelques propriétés et nous donnons l’expression analytique de la fonction caractéristique pour la nouvelle famille. Cette nouvelle famille est en fait une généralisation de la famille des densités des lois de Student de degrés de liberté impairs. Nous arrivons à des résultats de convergence similaires à la convergence observée des lois de Student lorsque le degré de liberté tend vers l’infini. Des résultats semblables de convergence ainsi que quelques propriétés sont développées pour la loi du rapport. Nous utilisons une approche bayésienne pour estimer le rapport de deux moyennes de variables aléatoires de lois normales. Des illustrations graphiques et des résultats des simulations sont présentés. Dans le troisième sujet, nous étendons la famille de distributions issue de la différence de deux variables aléatoires indépendantes de loi gamma, en considérant le cas où ces variables aléatoires sont positivement corrélées. Les densités de cette famille sont trouvées. La forme complexe de ces densités rend fastidieuses les méthodes d’estimation basées sur la vraisemblance. La méthode d’estimation basée sur la fonction caractéristique est utilisée, et l’approche continue est comparée à l’approche discrète. Par ailleurs, nous aboutissons à deux algorithmes simples permettant de générer facilement des données de deux variables aléatoires positivement corrélées et identiquement distribuées de loi gamma. Le meilleur estimateur équivariant pour le paramètre d’échelle est obtenu dans le cas de l’indépendance.
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.002 | 0.014 |
| Meta-epidemiology (narrow) | 0.001 | 0.001 |
| Meta-epidemiology (broad) | 0.001 | 0.002 |
| Bibliometrics | 0.002 | 0.002 |
| Science and technology studies | 0.001 | 0.001 |
| Scholarly communication | 0.003 | 0.003 |
| Open science | 0.001 | 0.001 |
| Research integrity | 0.001 | 0.002 |
| Insufficient payload (model declined to judge) | 0.006 | 0.002 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".