{"id":"W2991005916","doi":"10.1109/icst46399.2020.00019","title":"Comparing Offline and Online Testing of Deep Neural Networks: An Autonomous Car Case Study","year":2020,"lang":"en","type":"article","venue":"","topic":"Adversarial Robustness in Machine Learning","field":"Computer Science","cited_by":53,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Ottawa","funders":"","keywords":"Context (archaeology); Complement (music); Online and offline; Deep neural networks; Statistical hypothesis testing; Artificial neural network; Test data","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004004954,0.00094527,0.0004683443,0.0009701753,0.0003739881,0.0008169802,0.001977959,0.001446563,0.0007268373],"category_scores_gemma":[0.01963729,0.0003104122,0.0004718317,0.000740896,0.001157372,0.001400496,0.0009543179,0.001051422,0.0002824374],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001209319,"about_ca_system_score_gemma":0.000844403,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007030488,"about_ca_topic_score_gemma":0.00966085,"domain_scores_codex":[0.9958454,0.001722831,0.000313144,0.0007547538,0.001126125,0.0002377308],"domain_scores_gemma":[0.9691573,0.02093591,0.00154444,0.003594347,0.004056901,0.0007110491],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.002785537,0.004385346,0.1241715,0.0009636615,0.0005322748,0.002608152,0.001717929,0.6124148,0.02145296,0.005637381,0.008970316,0.2143602],"study_design_scores_gemma":[0.0002231928,0.002772196,0.03060746,0.00009351892,0.0000970205,0.0006794909,0.0011072,0.9244458,0.03004455,0.005105352,0.004736901,0.00008726888],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9767879,0.0003326706,0.01971918,0.0002842258,0.00006490632,0.0001230797,0.0004841675,0.0005282746,0.001675653],"genre_scores_gemma":[0.983284,0.00008720256,0.01503551,0.00009188913,0.00001738652,0.00007992295,0.0007593128,0.00005793032,0.00058685],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.007030488,"threshold_uncertainty_score":0.02118051,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06495997125813802,"score_gpt":0.299791241828165,"score_spread":0.234831270570027,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}