{"id":"W4224435188","doi":"10.5281/zenodo.6477785","title":"D3: A Massive Dataset of Scholarly Metadata for Analyzing the State of Computer Science Research","year":2022,"lang":"en","type":"paratext","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Scientific Computing and Data Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"National Research Council Canada","funders":"","keywords":"Metadata; Computer science; Data science; State (computer science); Information retrieval; World Wide Web; Programming language","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch","bibliometrics"],"consensus_categories":[],"category_scores_codex":[0.001562121,0.0008554013,0.0006648213,0.01080352,0.001006844,0.002994158,0.001374479,0.00167683,0.01961301],"category_scores_gemma":[0.01006303,0.000393766,0.0006526302,0.01683873,0.0005046973,0.002492793,0.002946701,0.001232971,0.03042808],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001172687,"about_ca_system_score_gemma":0.002449502,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00973125,"about_ca_topic_score_gemma":0.0178828,"domain_scores_codex":[0.9978509,0.0002948891,0.0002927152,0.0003159634,0.001063451,0.0001820712],"domain_scores_gemma":[0.9915235,0.002116213,0.0006394619,0.002277432,0.002278675,0.001164755],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0002961159,0.00008847232,0.005134527,0.001296828,0.00005675825,0.0002510118,0.0003261481,0.001544751,0.00351799,0.00393862,0.9437413,0.03980751],"study_design_scores_gemma":[0.0001067007,0.00004840794,0.02223134,0.0002112719,0.00003732601,0.0001928734,0.0006187179,0.00175428,0.004053552,0.004790588,0.9658834,0.00007138092],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.004670809,0.0003719081,0.001859459,0.0005937389,0.0001433153,0.00009482042,0.9812329,0.002573163,0.008459828],"genre_scores_gemma":[0.00743796,0.0003321081,0.004730244,0.00008886753,0.00007154087,0.0001246741,0.9828714,0.0003315571,0.004011568],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.9984379,"threshold_uncertainty_score":0.06561202,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.242958847849084,"score_gpt":0.4077420139333628,"score_spread":0.1647831660842788,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}