{"id":"W4389246169","doi":"10.26434/chemrxiv-2023-sw9kv","title":"Informative Training Data for Efficient Property Prediction in Metal-Organic Frameworks by Active Learning","year":2023,"lang":"en","type":"preprint","venue":"ChemRxiv","topic":"Machine Learning in Materials Science","field":"Materials Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Canadian Nautical Research Society","funders":"Agence Nationale de la Recherche","keywords":"Property (philosophy); Computer science; Partition (number theory); Tree (set theory); Machine learning; Regression; Set (abstract data type); Artificial intelligence; Class (philosophy); Training set; Data mining; Feature (linguistics); Limiting; Measure (data warehouse); Mathematics; Statistics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001665715,0.0008760518,0.0009907174,0.0008092553,0.0004250228,0.000804989,0.001647146,0.00123042,0.001236691],"category_scores_gemma":[0.003340277,0.0004051126,0.0007871587,0.0009572096,0.0007612623,0.001301673,0.0009302199,0.001855645,0.0004291833],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006117984,"about_ca_system_score_gemma":0.0005641394,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001933217,"about_ca_topic_score_gemma":0.002571102,"domain_scores_codex":[0.9995962,0.0001765073,0.0000198636,0.00007707928,0.00009847878,0.00003195096],"domain_scores_gemma":[0.9985966,0.0009957649,0.0001019777,0.000146236,0.0001232447,0.00003615925],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002249346,0.0002451352,0.001564926,0.0001737735,0.00006011527,0.00005918203,0.00008420619,0.8472554,0.007940905,0.01296396,0.00199018,0.1274373],"study_design_scores_gemma":[0.000004643982,0.000008754762,0.00004477002,0.000002845553,0.000001650649,0.000002773456,0.000003066047,0.9957855,0.001171424,0.002767808,0.0002041602,0.000002637817],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.06492057,0.0008510849,0.930363,0.0004470179,0.00003725032,0.00007010328,0.0004013604,0.001454097,0.001455455],"genre_scores_gemma":[0.6844932,0.0004609262,0.3116846,0.0002257301,0.00005688805,0.0003027562,0.001382114,0.0001327091,0.00126104],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.001933217,"threshold_uncertainty_score":0.008809209,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05782182830932876,"score_gpt":0.3068086629101242,"score_spread":0.2489868346007954,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}