{"id":"W2807245502","doi":"10.63317/2k4h99c3w2uz","title":"A New Corpus to Support Text Mining for the Curation of Metabolites in the ChEBI Database","year":2018,"lang":"en","type":"article","venue":"","topic":"Biomedical Text Mining and Ontologies","field":"Biochemistry, Genetics and Molecular Biology","cited_by":10,"is_retracted":false,"has_abstract":true,"ca_institutions":"Open Text (Canada)","funders":"European Commission","keywords":"Computer science; Matching (statistics); Protocol (science); Information retrieval; Data curation; Biomedical text mining; Natural language processing; Text mining; Data mining","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0003801753,0.00006199779,0.00007828003,0.00001896895,0.00004152026,0.00001193967,0.0002370383,0.00005374408,0.00004002348],"category_scores_gemma":[0.0004585011,0.00003075477,0.00003524466,0.00009793711,0.00008883973,0.000002186594,0.00005912019,0.0000268333,0.000004135411],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000001647534,"about_ca_system_score_gemma":0.00006399929,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00008728189,"about_ca_topic_score_gemma":0.0003424461,"domain_scores_codex":[0.9994898,0.0000255223,0.0001402542,0.0001402541,0.00007665208,0.0001274647],"domain_scores_gemma":[0.9995354,0.00009647951,0.00003822571,0.0002568126,0.00004415166,0.00002897169],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"bench_or_experimental","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0002099836,0.00005439468,0.001661538,0.0000163863,0.00004756785,6.54941e-7,0.001367938,0.000001538327,0.5034884,0.001610012,0.1361918,0.3553498],"study_design_scores_gemma":[0.0005068695,0.0008945653,0.003959807,0.000009992169,0.00002877731,0.000007459293,0.001690251,0.0001282452,0.3190149,0.000109152,0.6735477,0.0001022182],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7228114,0.001958965,0.2616125,0.008628824,0.0004604675,0.0008778361,0.00008507647,0.00002165177,0.003543312],"genre_scores_gemma":[0.9729187,0.00004588998,0.02380914,0.001588564,0.0003400197,0.00003459278,0.00006046181,0.000005775549,0.001196794],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.537356,"threshold_uncertainty_score":0.1254143,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04024246612935126,"score_gpt":0.3308117969133884,"score_spread":0.2905693307840371,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}