{"id":"W7126375877","doi":"10.21428/594757db.a4de9762","title":"Robust Reinforcement Learning for Linear Temporal Logic Specifications with Finite Trajectory Duration","year":2024,"lang":"en","type":"article","venue":"","topic":"Formal Methods in Verification","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"","keywords":"Temporal logic; Linear temporal logic; Reinforcement learning; A priori and a posteriori; Variety (cybernetics); Trajectory; Limit (mathematics); Robot; Robotics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0005523953,0.0001064984,0.00008365588,0.0001333868,0.0001692138,0.0002051825,0.0002890365,0.00004637433,0.00004285466],"category_scores_gemma":[0.00009921896,0.00008199631,0.00004398408,0.00042131,0.0000324983,0.0007055521,0.00003323259,0.0001377991,0.00007180241],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00007129469,"about_ca_system_score_gemma":0.00008834632,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00000759899,"about_ca_topic_score_gemma":0.00000757638,"domain_scores_codex":[0.9990074,0.00004982852,0.000263657,0.0003247276,0.0001848859,0.0001694915],"domain_scores_gemma":[0.999305,0.0001605838,0.0000688907,0.0003175146,0.000103164,0.00004481084],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00001525431,0.00002031651,0.00006529019,0.00006557178,0.00001797087,0.000001912008,0.0006365246,0.3360819,0.0005148518,0.6519587,0.0005040338,0.01011764],"study_design_scores_gemma":[0.0001064654,0.0002342138,0.0002197836,0.00002511479,0.000006561986,0.000005576276,0.00006676911,0.9700595,0.002405505,0.0006102203,0.02613035,0.0001299675],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.0002138338,0.0000519952,0.9923618,0.0006261425,0.0002838799,0.0003832458,5.969939e-7,0.0004878227,0.005590711],"genre_scores_gemma":[0.1958727,0.00001173681,0.7999204,0.00007336511,0.0001066628,0.0001102218,0.00002880172,0.00001016218,0.003865905],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.6513485,"threshold_uncertainty_score":0.3343712,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1403290417013348,"score_gpt":0.3084753156685883,"score_spread":0.1681462739672535,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}