{"id":"W2883256923","doi":"10.1145/3239570","title":"Evaluation-as-a-Service for the Computational Sciences","year":2018,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Machine Learning and Data Classification","field":"Computer Science","cited_by":44,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Data science; Crowdsourcing; Field (mathematics); Executable; Domain (mathematical analysis); Service (business); Confidentiality; Big data; Work (physics); World Wide Web; Data mining; Computer security","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1104304,0.003889116,0.005660941,0.005957027,0.002706884,0.02833686,0.008920494,0.009367264,0.06937005],"category_scores_gemma":[0.3549123,0.002231881,0.002885771,0.01181401,0.006521523,0.03369898,0.02044476,0.01377001,0.06938732],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.009390213,"about_ca_system_score_gemma":0.01526825,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003440714,"about_ca_topic_score_gemma":0.00159119,"domain_scores_codex":[0.8401427,0.1020142,0.009822131,0.008732376,0.03572103,0.003567586],"domain_scores_gemma":[0.5906311,0.1870697,0.01299012,0.1253466,0.06619105,0.01777153],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00171319,0.0004707482,0.00191778,0.002109351,0.000563507,0.0004571346,0.00148201,0.007057989,0.002716694,0.1678934,0.4142398,0.3993784],"study_design_scores_gemma":[0.0005427951,0.0002899703,0.001377192,0.001204523,0.00008520013,0.000399524,0.0006736586,0.05354907,0.00253817,0.2977712,0.6413067,0.0002619785],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.001902376,0.004078073,0.8484744,0.01977888,0.003116607,0.002646337,0.002885493,0.05825112,0.05886663],"genre_scores_gemma":[0.18111,0.01123399,0.6511757,0.01394239,0.007840428,0.01134038,0.02310948,0.05245792,0.04778972],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.1104304,"threshold_uncertainty_score":0.5840189,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2061877675601156,"score_gpt":0.4578079204475153,"score_spread":0.2516201528873997,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}