{"id":"W4392350883","doi":"10.1088/2632-2153/ad2f52","title":"Autonomous data extraction from peer reviewed literature for training machine learning models of oxidation potentials","year":2024,"lang":"en","type":"article","venue":"Machine Learning Science and Technology","topic":"Machine Learning in Materials Science","field":"Materials Science","cited_by":10,"is_retracted":false,"has_abstract":true,"ca_institutions":"Vector Institute; University of Toronto","funders":"Canada First Research Excellence Fund; University of Toronto; European Commission","keywords":"Computer science; Training (meteorology); Data extraction; Peer review; Extraction (chemistry); Artificial intelligence; Machine learning; MEDLINE; Chemistry; Geography","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.01552915,0.00174993,0.002259708,0.03352531,0.001454844,0.004101316,0.003234761,0.001484635,0.01003212],"category_scores_gemma":[0.07871936,0.0009228583,0.002179292,0.01560583,0.001065414,0.004824652,0.003621556,0.001608065,0.01183037],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001691808,"about_ca_system_score_gemma":0.01225203,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004088075,"about_ca_topic_score_gemma":0.00908803,"domain_scores_codex":[0.991981,0.00198753,0.001559601,0.001764387,0.002448207,0.0002592031],"domain_scores_gemma":[0.9240993,0.03797895,0.006987887,0.007875455,0.02202456,0.001033796],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0007216939,0.0004508997,0.02308806,0.03032019,0.0006767123,0.001668549,0.001246668,0.01360223,0.03824053,0.01387521,0.1865436,0.6895656],"study_design_scores_gemma":[0.0005195419,0.0008010854,0.02271016,0.004396625,0.001129575,0.001042933,0.001736641,0.1199659,0.08457598,0.0635388,0.6989772,0.0006055338],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"dataset","genre_gemma":"methods","genre_scores_codex":[0.05159293,0.02124097,0.3966829,0.005595728,0.001617308,0.005435008,0.4600494,0.03867447,0.01911135],"genre_scores_gemma":[0.1137699,0.005117383,0.5965787,0.0006474357,0.0007046206,0.005037666,0.2723754,0.001573874,0.004195021],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.9844708,"threshold_uncertainty_score":0.08212703,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0426779243544447,"score_gpt":0.3172604992317604,"score_spread":0.2745825748773157,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}