{"id":"W4393779445","doi":"10.5281/zenodo.8381476","title":"MatSciML: A Broad, Multi-Task Benchmark for Solid-State Materials Modeling","year":2023,"lang":"en","type":"dataset","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Machine Learning in Materials Science","field":"Materials Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Vector Institute","funders":"","keywords":"Benchmark (surveying); Task (project management); Solid-state; Computer science; Engineering; Systems engineering; Geography; Cartography; Engineering physics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003634524,0.004117456,0.001666277,0.002536583,0.001383813,0.003201381,0.006375711,0.00441754,0.007960602],"category_scores_gemma":[0.01314904,0.0008984644,0.002742681,0.003244176,0.001457735,0.003879148,0.002842445,0.003104141,0.004585927],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002422385,"about_ca_system_score_gemma":0.003502249,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01881129,"about_ca_topic_score_gemma":0.02257912,"domain_scores_codex":[0.9973226,0.000740886,0.0002009907,0.0007077921,0.0007767974,0.0002508469],"domain_scores_gemma":[0.9957244,0.002087737,0.000259469,0.0008385034,0.0007623784,0.0003273908],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0008499162,0.000833231,0.005038087,0.002194389,0.0005500953,0.000328362,0.00009922583,0.7325693,0.003459003,0.01231052,0.1677827,0.07398528],"study_design_scores_gemma":[0.000169959,0.0001554759,0.0008108978,0.00005946989,0.00003498503,0.00006819831,0.00004522764,0.9670075,0.004241044,0.01146958,0.01590494,0.00003277925],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"dataset","genre_scores_codex":[0.2827828,0.0162274,0.3164088,0.01104716,0.003815755,0.001713513,0.164897,0.1442813,0.05882629],"genre_scores_gemma":[0.429678,0.002462036,0.3059505,0.002365728,0.0004280176,0.001990756,0.2397782,0.007470276,0.009876571],"genre_candidate":"dataset","genre_consensus":null,"teacher_disagreement_score":0.01881129,"threshold_uncertainty_score":0.03740358,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04824776266788908,"score_gpt":0.3044233479694183,"score_spread":0.2561755853015292,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}