Role Assignment for Agent Evaluation Under Uncertainty: A Distributionally Robust Approach
Notice bibliographique
Résumé
Role-based collaboration (RBC) is an emerging and advanced methodology for problem-solving. A critical aspect of RBC theory is agent evaluation, which aims to assess agents’ abilities through a qualification value derived from a comprehensive analysis of their characteristics. This evaluation directly impacts the quality of role assignments. Existing research typically assumes that the qualification value is either predetermined, based on multiscale criteria, or following a predefined distribution. These assumptions, however, are overly idealistic and difficult to generalize, failing to capture the inherent volatility of the qualification value. To address this challenge, this article introduces a Wasserstein-based ambiguity set to model potential fluctuations in the qualification value, drawing on empirical distributions derived from historical sample data. Building upon the RBC framework and its abstract model environments, classes, agents, roles, groups, and objects (E-CARGO), we propose two data-driven models: distributionally robust group role assignment (DRGRA) and group multirole assignment (DRGMRA). These models aim to achieve more robust and optimal role assignments under uncertainty in agent evaluation. Leveraging strong duality, we reformulate DRGRA and DRGMRA as tractable finite mixed 0–1 convex problems, providing an approximation framework that reduces computational complexity. Notably, these models are adaptable to other problems with no uncertainty in agent evaluation, highlighting their modeling scalability. Experimental results demonstrate the effectiveness and robustness of the proposed models.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction distillée sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Apprise à partir de 10 348 étiquettes directes de Codex et de 10 348 étiquettes directes de Gemma. Le mode candidate est l'union des têtes enseignantes seuillées; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont ni des étiquettes humaines ni des étiquettes directes de modèles de pointe.
Scores Codex et Gemma par catégorie
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,003 | 0,000 |
| Méta-épidémiologie (sens strict) | 0,000 | 0,000 |
| Méta-épidémiologie (sens large) | 0,000 | 0,000 |
| Bibliométrie | 0,000 | 0,001 |
| Études des sciences et des technologies | 0,001 | 0,000 |
| Communication savante | 0,001 | 0,000 |
| Science ouverte | 0,000 | 0,000 |
| Intégrité de la recherche | 0,000 | 0,000 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,000 | 0,000 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule tête enseignante, pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».