{"id":"W2807245502","doi":"10.63317/2k4h99c3w2uz","title":"A New Corpus to Support Text Mining for the Curation of Metabolites in the ChEBI Database","year":2018,"lang":"en","type":"article","venue":"","topic":"Biomedical Text Mining and Ontologies","field":"Biochemistry, Genetics and Molecular Biology","cited_by":10,"is_retracted":false,"has_abstract":true,"ca_institutions":"Open Text (Canada)","funders":"European Commission","keywords":"Computer science; Matching (statistics); Protocol (science); Information retrieval; Data curation; Biomedical text mining; Natural language processing; Text mining; Data mining","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002813018,0.001176207,0.001398865,0.01444598,0.002054923,0.003029511,0.001188079,0.001391196,0.01379209],"category_scores_gemma":[0.01330609,0.000595648,0.0009004359,0.01306264,0.0009283168,0.003620615,0.003202324,0.002046812,0.007507294],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001302717,"about_ca_system_score_gemma":0.004143104,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004975778,"about_ca_topic_score_gemma":0.00928789,"domain_scores_codex":[0.9977055,0.0004131215,0.000565915,0.0006165063,0.0006061847,0.00009281367],"domain_scores_gemma":[0.9881264,0.006151917,0.0008473848,0.00143833,0.00266755,0.000768401],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.002053401,0.0009032878,0.01101233,0.01842728,0.0004905697,0.003766906,0.003948854,0.004386331,0.1112607,0.01992368,0.4846738,0.339153],"study_design_scores_gemma":[0.000344082,0.0001852841,0.02254915,0.0009161888,0.00032231,0.001622574,0.001180653,0.01007343,0.02351264,0.00857811,0.9305224,0.0001931832],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"methods","genre_scores_codex":[0.06740744,0.008087261,0.1028989,0.003433286,0.001817619,0.002366747,0.7747703,0.01763439,0.0215841],"genre_scores_gemma":[0.04309653,0.002358309,0.2235206,0.0005485601,0.0003372899,0.003280428,0.7186981,0.002157084,0.006003089],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.01444598,"threshold_uncertainty_score":0.04613918,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04024246612935126,"score_gpt":0.3308117969133884,"score_spread":0.2905693307840371,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}