BC Data ScoutTM: A New Tool To Investigate Datasets For Health Research
Notice bibliographique
Résumé
IntroductionBC’s Ministry of Health (MOH) maintains many administrative databases with rich information and analytical potential. Researchers are keen to use these data for both discovery and applied research. Historically, limited views of data availability and populations therein have supported study feasibility. Therefore, we developed BC Data ScoutTM, a cohort browser. Objectives and ApproachWe developed a cohort browser service to provide information to researchers planning a study using MOH data. The objective was to create a tool that is simple to use, provides quick results and is free to users to encourage its use. A better understanding of the data available can improve study quality and expand the user-base by giving researchers access to information not previously available during the planning stages. The tool will be evaluated by examining the number of requests received and a user satisfaction survey. Plans are in place to expand into additional data sources and extend query sophistication. ResultsThe BC Data ScoutTM online tool provides cohort information in the form of highly aggregated, approximate results to researchers planning a study. It was developed by the MOH, the BC SUPPORT Unit and Population Data BC (PopData) and was launched in February 2018. The service is delivered by PopData. BC Data ScoutTM offers province-wide information for query, is accessible to a wide group of eligible researchers, and has data availability from the year 2000 onwards. Four types of MOH data are available for query: hospital data; physician data; pharmaceutical data; and demographics. In addition to determining study feasibility, the aggregate reports also help to further refine a full data access request and provide enough information to complete and strengthen a funding application. Conclusion/ImplicationsBC Data ScoutTM will be beneficial for researchers planning to request data. This preliminary information may increase the chances of meaningful research studies to obtain funding, and the production of relevant, high-quality research results. BC will be among the first jurisdictions across Canada to offer this type of feasibility service.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,051 | 0,164 |
| Méta-épidémiologie (sens strict) | 0,002 | 0,002 |
| Méta-épidémiologie (sens large) | 0,002 | 0,003 |
| Bibliométrie | 0,013 | 0,015 |
| Études des sciences et des technologies | 0,002 | 0,001 |
| Communication savante | 0,008 | 0,011 |
| Science ouverte | 0,004 | 0,013 |
| Intégrité de la recherche | 0,003 | 0,005 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,102 | 0,025 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».