{"id":"W7104183057","doi":"","title":"LLMs as Judges: Toward The Automatic Review of GSN-compliant Assurance Cases","year":2025,"lang":"","type":"article","venue":"ArXiv.org","topic":"Safety Systems Engineering in Autonomy","field":"Engineering","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Canada First Research Excellence Fund","keywords":"Leverage (statistics); Quality assurance; Harm; Task (project management); Obstacle; Risk assessment","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03368169,0.001452235,0.001331222,0.005952762,0.001818654,0.006947354,0.004447903,0.002663444,0.004669462],"category_scores_gemma":[0.197055,0.0009866036,0.001390243,0.002233317,0.002512601,0.00919518,0.007477346,0.003988893,0.004847254],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00251855,"about_ca_system_score_gemma":0.00782381,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005985083,"about_ca_topic_score_gemma":0.008649546,"domain_scores_codex":[0.9397547,0.03229938,0.005953637,0.006624351,0.01424643,0.001121511],"domain_scores_gemma":[0.806406,0.1210615,0.01618053,0.02823516,0.02402728,0.004089546],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001251897,0.0007215578,0.01375173,0.002292775,0.0001988954,0.00131619,0.009375026,0.01519963,0.03839255,0.03227143,0.09795071,0.7872776],"study_design_scores_gemma":[0.0004924611,0.000557409,0.00509734,0.0008252267,0.000231684,0.001397306,0.003490022,0.6546601,0.07300544,0.05430917,0.2055742,0.0003596745],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.05535311,0.001292276,0.8259344,0.004267473,0.0005566569,0.003423466,0.002166022,0.09615904,0.01084763],"genre_scores_gemma":[0.2027781,0.0003703151,0.781863,0.00142632,0.0001604343,0.0007181821,0.005401525,0.003172113,0.004110001],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.03368169,"threshold_uncertainty_score":0.1781279,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03308860752920712,"score_gpt":0.2738435258553596,"score_spread":0.2407549183261525,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}