{"id":"W3184919107","doi":"10.1007/978-3-030-81685-8_29","title":"Effective Hybrid System Falsification Using Monte Carlo Tree Search Guided by QB-Robustness","year":2021,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Formal Methods in Verification","field":"Computer Science","cited_by":36,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"JST-Mirai Program; Exploratory Research for Advanced Technology; Japan Society for the Promotion of Science; Natural Sciences and Engineering Research Council of Canada; Canadian Institute for Advanced Research","keywords":"Robustness (evolution); Computer science; Tree traversal; Scalability; Computation; Theoretical computer science; Mathematical optimization; Algorithm; Mathematics","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[{"model":"gemma","categories":[],"domain":null,"study_design":"simulation_or_modeling","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"high","status":"direct model label, unvalidated"},{"model":"gpt","categories":[],"domain":null,"study_design":"simulation_or_modeling","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"high","status":"direct model label, unvalidated"}],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002008371,0.001011134,0.001335707,0.001012926,0.0006409688,0.001036459,0.0011277,0.001027074,0.003041349],"category_scores_gemma":[0.00681515,0.0004056223,0.001170776,0.00053671,0.00140759,0.00102214,0.001338386,0.001150806,0.0002941509],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001112149,"about_ca_system_score_gemma":0.001972789,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005156351,"about_ca_topic_score_gemma":0.003957551,"domain_scores_codex":[0.9985797,0.0005161653,0.00006812396,0.0001781461,0.0004725616,0.0001853257],"domain_scores_gemma":[0.9946775,0.003815172,0.0004058661,0.0003672104,0.0005811867,0.0001531057],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001259932,0.00004816894,0.001439837,0.00009858076,0.00004085192,0.0001139846,0.00005812833,0.9626319,0.003810695,0.0112167,0.0004853541,0.01992994],"study_design_scores_gemma":[0.000007806573,0.00002055207,0.00005557708,0.00000501945,0.000005310102,0.000009917029,0.0000061861,0.9964362,0.0007118424,0.002617421,0.0001212315,0.000002832665],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.08716977,0.0002870371,0.9068879,0.000307605,0.00003967283,0.0001108147,0.00009458511,0.001879526,0.003223051],"genre_scores_gemma":[0.8449983,0.00007006917,0.1535196,0.0001480034,0.00001397626,0.000115053,0.0001847202,0.0001687716,0.0007814619],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.005156351,"threshold_uncertainty_score":0.01062143,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04106848967663938,"score_gpt":0.3003669894834916,"score_spread":0.2592984998068522,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}