Quantifying agreement and gaps between regional and global barrier datasets to better understand uncertainties introduced into large-scale river studies
Bibliographic record
Abstract
Des millions de barrières anthropiques obstruent les rivières du monde et renferment des réservoirs (Lehner et al. 2011a). La hauteur et le volume de réservoir de ces barrières varient grandement, tout comme les rivières sur lesquelles elles sont situées. Bien qu'initialement construites dans le but de protéger les terres et les populations environnantes contre les inondations et de les approvisionner en hydroélectricité et en eau pour l'irrigation, les barrières fluviales ont également des conséquences socio-environnementales imprévues et néfastes. En plus de perturber la migration des poissons, les barrières fluviales et leurs réservoirs peuvent forcer le déplacement de communautés humaines et provoquer des changements aux cycles globaux des nutriments dans l'environnement.Deux bases de données globales sont communément utilisées pour étudier les impacts socio- environnementaux des barrières fluviales: le Global Reservoir and Dam Database (GRanD; Lehner et al. 2011) et le Global Georeferenced Database of Dams (GOOD2; Mulligan et al. 2009). GRanD contient les coordonnées géospatiales de 6862 barrières fluviales ainsi que de l'information sur les caractéristiques physiques de ces barrières, tels que la taille et le volume de leur réservoir. GOOD2 contient les coordonnées géospatiales de 36,193 barrières fluviales. L'exhaustivité de ces bases de données –ou l'exactitude de ces données à représenter les barrières retrouvées sur terre –est inconnue, ce qui peut créer des répercussions majeures. Toute incertitude introduite dans une étude par l'usage de ces bases de données ne peut être quantifiée, alors que les résultats pourraient être sévèrement biaisés ou erronés. Les bases de données à échelle régionale contiennent généralement plus de barrières pour leur région que celles retrouvées dans les bases de données globales. Elles peuvent donc être comparées à leurs équivalents globaux pour déterminer l'accord entre ces deux échelles, identifier les lacunes dans l'information fournie par les bases de données globales et quantifier le degré d'omission à l'aide de mesures statistiques.Cette étude a pour référence régionale les états contigus des États-Unis, puisqu'une grande diversité de tailles de rivières et de caractéristiques géophysiques est retrouvée dans ce pays. Le US National Anthropogenic Barrier Dataset (NABD; Ostroff et al. 2013) est une base de données approfondie et fiable des barrières fluviales du pays contenant les coordonnées géospatiales de 52,456 très petites à très grandes barrières aux États-Unis, en plus d'information sur la taille et le volume du réservoir de chaque barrière. Dans cette thèse, cette base de données américaine a été épluchée puis alignée avec le réseau de rivières HydroSHEDS (Lehner et al. 2008) pour permettre une comparaison stratifiée entre cette base de données régionale et celles globales en termes a) de taille de la barrière et volume du réservoir, b) de type d'usage de la barrière et c) de taille des rivières sur lesquelles les barrières sont situées.Les résultats de cette étude démontrent que, lorsqu'utilisées en conjonction, les bases de données globales atteignent un accord maximal avec les données du NABD pour les barrières fluviales de plus de 15 m de hauteur contenant des réservoirs de plus de 100 millions m3; elles identifient 96% de ces barrières situées sur des rivières avec un débit d'eau de 10 à 99 m3/s. Lorsqu'utilisée indépendamment, la base de données GRanD identifie 74% de barrières avec des réservoirs de plus de 100 millions m3.
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.035 | 0.095 |
| Meta-epidemiology (narrow) | 0.001 | 0.001 |
| Meta-epidemiology (broad) | 0.001 | 0.001 |
| Bibliometrics | 0.010 | 0.015 |
| Science and technology studies | 0.001 | 0.001 |
| Scholarly communication | 0.004 | 0.006 |
| Open science | 0.002 | 0.007 |
| Research integrity | 0.002 | 0.001 |
| Insufficient payload (model declined to judge) | 0.003 | 0.001 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".