{"id":"W4399577082","doi":"10.1145/3650105.3652291","title":"Assessing the Impact of GPT-4 Turbo in Generating Defeaters for Assurance Cases","year":2024,"lang":"en","type":"article","venue":"","topic":"Safety Systems Engineering in Autonomy","field":"Engineering","cited_by":8,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Ottawa; York University","funders":"","keywords":"Turbo; Computer science; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008359078,0.001047494,0.00042037,0.001661138,0.0004632516,0.002423852,0.002086733,0.00184176,0.004473797],"category_scores_gemma":[0.0591077,0.0005384319,0.00112326,0.0006889123,0.001205304,0.003585786,0.0020937,0.002308174,0.001226725],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001252191,"about_ca_system_score_gemma":0.001849673,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003441347,"about_ca_topic_score_gemma":0.004958769,"domain_scores_codex":[0.9946281,0.002856587,0.0003910873,0.0005282351,0.001406952,0.0001891292],"domain_scores_gemma":[0.9242068,0.06131835,0.002160372,0.0073054,0.00417961,0.0008295169],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.003043851,0.002794384,0.04580403,0.00206555,0.0002860828,0.001202913,0.004833311,0.552595,0.04099227,0.04668179,0.01043526,0.2892657],"study_design_scores_gemma":[0.0001643851,0.0009157858,0.003000914,0.0001489977,0.00007437927,0.0003645491,0.0005976314,0.962779,0.01554662,0.009675801,0.006671194,0.00006064416],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6170685,0.0002255828,0.3452114,0.0007881019,0.0001207423,0.001255812,0.00196259,0.01395595,0.01941143],"genre_scores_gemma":[0.6208061,0.0001288114,0.3724865,0.0002062878,0.00001177891,0.0003587726,0.002691131,0.0007881699,0.002522389],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.008359078,"threshold_uncertainty_score":0.04420751,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02299245954635233,"score_gpt":0.3056516118762312,"score_spread":0.2826591523298789,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}