{"id":"W3190588453","doi":"10.3390/data6080084","title":"The Automatic Detection of Dataset Names in Scientific Articles","year":2021,"lang":"en","type":"article","venue":"Data","topic":"Topic Modeling","field":"Computer Science","cited_by":18,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Nederlandse Organisatie voor Wetenschappelijk Onderzoek; Canadian Institute of Steel Construction","keywords":"Computer science; Named-entity recognition; Annotation; Task (project management); Natural language processing; Sentence; Feature (linguistics); Set (abstract data type); Artificial intelligence; Code (set theory); Information retrieval; Baseline (sea); Linguistics; Programming language","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.004893071,0.0009207206,0.0006364086,0.009043719,0.001109383,0.002021788,0.001150202,0.001282892,0.001736139],"category_scores_gemma":[0.0187018,0.0003512703,0.0008184399,0.006277673,0.0006306232,0.003691401,0.001581212,0.001110964,0.004396285],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008263946,"about_ca_system_score_gemma":0.001561098,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002664386,"about_ca_topic_score_gemma":0.006764744,"domain_scores_codex":[0.9953789,0.001167099,0.0006589513,0.001544266,0.001004657,0.0002461745],"domain_scores_gemma":[0.9716234,0.01396964,0.004356189,0.002859478,0.006341815,0.0008493278],"domain_codex":null,"domain_gemma":"reporting","domain_candidate":"reporting","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000992422,0.0005106914,0.133008,0.00788343,0.000371546,0.002020806,0.004074797,0.009351143,0.1016791,0.01051116,0.2145776,0.5150192],"study_design_scores_gemma":[0.0001068594,0.0007220499,0.2075551,0.0007488759,0.0004840919,0.004381821,0.003512681,0.1442869,0.1951506,0.01594427,0.4267844,0.0003223708],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.530582,0.01237383,0.213354,0.002876841,0.002346716,0.001014972,0.185809,0.02896737,0.0226752],"genre_scores_gemma":[0.4102347,0.002247144,0.2661295,0.0005339732,0.0008666245,0.0007120363,0.3096562,0.001603837,0.008016094],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9951069,"threshold_uncertainty_score":0.0258773,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06923547144482206,"score_gpt":0.2931762461491873,"score_spread":0.2239407747043652,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}