{"id":"W3120593931","doi":"10.1101/2021.01.11.21249624","title":"Emergence and Evolution of Big Data Science in HIV Research: Bibliometric Analysis of Federally Sponsored Studies 2000-2019","year":2021,"lang":"en","type":"preprint","venue":"medRxiv","topic":"Data-Driven Disease Surveillance","field":"Medicine","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"National Institute of Allergy and Infectious Diseases; National Institutes of Health","keywords":"Big data; Bibliometrics; Human immunodeficiency virus (HIV); China; Library science; Metadata; Data science; Political science; Medicine; Computer science; Family medicine; Data mining; World Wide Web","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[{"model":"gemma","categories":["bibliometrics"],"domain":null,"study_design":"observational","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"},{"model":"gpt","categories":["bibliometrics"],"domain":null,"study_design":"observational","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"high","status":"direct model label, unvalidated"}],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch","bibliometrics"],"consensus_categories":["bibliometrics"],"category_scores_codex":[0.008930435,0.0002306928,0.001337185,0.1088132,0.00008527557,0.00004481623,0.001270603,0.0001192746,0.00006855635],"category_scores_gemma":[0.01659647,0.0002123117,0.0001217472,0.2266761,0.00146085,0.0002552927,0.005235413,0.0005282138,0.000003473491],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002179607,"about_ca_system_score_gemma":0.002313071,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001022724,"about_ca_topic_score_gemma":0.001030731,"domain_scores_codex":[0.9946912,0.0005631875,0.0009260078,0.001341177,0.002022827,0.0004555884],"domain_scores_gemma":[0.9935903,0.0005719842,0.0004155714,0.003038988,0.002178014,0.0002051691],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0001678872,0.0002591514,0.9874648,0.0009396534,0.0008538004,0.00006767342,0.0003302493,0.0001648679,0.006032962,0.00001852142,0.000762611,0.00293785],"study_design_scores_gemma":[0.0004462517,0.00004979832,0.9924282,0.0006092199,0.0005403941,0.00000223878,0.0008565247,0.004437068,0.0003613934,0.0000389056,0.00007783807,0.0001521519],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9636514,0.03363768,0.0001535154,0.0002365142,0.0003015149,0.0004264575,0.001381262,0.00002008157,0.0001915892],"genre_scores_gemma":[0.9824844,0.01554293,0.001081125,0.000008344847,0.00004718463,0.00001773048,0.0006687792,0.00001610497,0.0001333826],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.117863,"threshold_uncertainty_score":0.9916872,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2489796549362237,"score_gpt":0.4376911789858776,"score_spread":0.1887115240496538,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}