{"id":"W4417427795","doi":"10.1039/d5cp03741g","title":"WTMAD-4: a fair weighting scheme for GMTKN55","year":2025,"lang":"en","type":"article","venue":"Physical Chemistry Chemical Physics","topic":"Machine Learning in Materials Science","field":"Materials Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Dalhousie University","funders":"Natural Sciences and Engineering Research Council of Canada; Killam Trusts; Royal Society","keywords":"Weighting; Metric (unit); Set (abstract data type); Scheme (mathematics); Component (thermodynamics); Absolute deviation; Standard deviation","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01340855,0.00145757,0.001410651,0.002786495,0.001803719,0.002346216,0.004625665,0.002609714,0.004992492],"category_scores_gemma":[0.04982674,0.0004400096,0.001272555,0.002235453,0.001642064,0.002848354,0.003512977,0.003002969,0.001725069],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002324679,"about_ca_system_score_gemma":0.003322094,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0105484,"about_ca_topic_score_gemma":0.01838086,"domain_scores_codex":[0.9944332,0.002242574,0.0003898795,0.0007311192,0.001897626,0.0003055006],"domain_scores_gemma":[0.9901276,0.003610149,0.0005396421,0.002972797,0.002449113,0.0003007127],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001361782,0.0005472032,0.0118838,0.001115214,0.0006594827,0.0001800884,0.0004298169,0.5346946,0.009240687,0.07021406,0.07727369,0.2923996],"study_design_scores_gemma":[0.0001373732,0.0003313237,0.001915706,0.0001466296,0.00005587511,0.0001208979,0.0001449754,0.9220846,0.008964888,0.04559525,0.02040161,0.0001009616],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.1653465,0.00431535,0.7821606,0.002648629,0.001507525,0.0009594547,0.009876404,0.01522528,0.01796017],"genre_scores_gemma":[0.4514258,0.0005039473,0.5247358,0.0009895542,0.0001655873,0.001056692,0.01262322,0.003143413,0.00535594],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01340855,"threshold_uncertainty_score":0.070912,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.009084065903775366,"score_gpt":0.2818966930704762,"score_spread":0.2728126271667008,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}