{"id":"W4402977984","doi":"10.1145/3640310.3674098","title":"Towards Automated Test Scenario Generation for Assuring COLREGs Compliance of Autonomous Surface Vehicles","year":2024,"lang":"en","type":"article","venue":"","topic":"Maritime Navigation and Safety","field":"Engineering","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"Universitas Brawijaya","keywords":"Compliance (psychology); Test (biology); Computer science; Systems engineering; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0001503315,0.00009656659,0.0001325435,0.00003386515,0.00003875533,0.00005881042,0.00006733136,0.00006470323,0.0001107838],"category_scores_gemma":[0.00002434396,0.00009695017,0.00004781031,0.0001457992,0.00001627302,0.0001061495,0.00001165629,0.0000648134,0.00002797942],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00007529445,"about_ca_system_score_gemma":0.00004317164,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00004427313,"about_ca_topic_score_gemma":0.00002727866,"domain_scores_codex":[0.9993998,0.00000717599,0.0002357753,0.0001321082,0.00009193234,0.0001332076],"domain_scores_gemma":[0.9996862,0.00008904677,0.00001383997,0.0001066524,0.00006589375,0.0000382996],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"bench_or_experimental","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000007346575,0.00005998767,0.0006725691,0.001759649,0.0001121325,0.000005723536,0.0004329821,0.4297466,0.4882532,0.007398557,0.03707887,0.03447244],"study_design_scores_gemma":[0.0001393066,0.00001835905,0.00100872,0.00006655623,0.000008820341,0.000002317983,0.000008352645,0.9131056,0.07758968,0.00003658477,0.007910323,0.0001053676],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6875831,0.002560566,0.2278195,0.001544375,0.002351151,0.001747472,0.0004676766,0.01426128,0.06166487],"genre_scores_gemma":[0.9850833,0.00001698496,0.01351015,0.00002350797,0.00006121468,0.00001242482,0.00006020184,0.00002525187,0.001206925],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.483359,"threshold_uncertainty_score":0.3953513,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03684080707866547,"score_gpt":0.2783086528893733,"score_spread":0.2414678458107078,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}