{"id":"W4413180594","doi":"10.1109/isscs66034.2025.11105702","title":"Learning Optimal Agent Behavior From a Synthetic Reasoning Action Dataset","year":2025,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Ontario Ministry of Research, Innovation and Science","keywords":"Computer science; Action (physics); Artificial intelligence; Machine learning","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.000209794,0.0001311306,0.000127395,0.0001141758,0.0002195979,0.0003208515,0.0006700182,0.00006150799,0.0001582714],"category_scores_gemma":[0.0001372158,0.0001274853,0.00004311001,0.0002715499,0.00002607183,0.0004312646,0.0004859821,0.0002878813,0.0002098377],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00008653667,"about_ca_system_score_gemma":0.0000561257,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001959228,"about_ca_topic_score_gemma":0.000004448885,"domain_scores_codex":[0.9988053,0.00008541227,0.0002169879,0.0003926321,0.0002469422,0.0002527039],"domain_scores_gemma":[0.9990997,0.0001314242,0.00008675769,0.0005911994,0.0000327184,0.00005815624],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000008773168,0.0000521042,0.004132252,0.00001149762,0.00004923611,0.00003342477,0.000320823,0.9319189,0.001717843,0.008931251,0.006713313,0.04611062],"study_design_scores_gemma":[0.0002197486,0.00006496137,0.004542383,0.00006070134,0.0000391586,0.000003130224,0.0001414405,0.9526994,0.001789037,0.00002024858,0.04023869,0.0001810895],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02006204,0.00001915974,0.9758779,0.0002005064,0.0005875588,0.0001331268,0.000006121494,0.0002969713,0.002816614],"genre_scores_gemma":[0.7840981,0.00002490039,0.2074043,0.0003792014,0.00005708707,0.00004476226,0.0003936619,0.0000139779,0.007584019],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.7684736,"threshold_uncertainty_score":0.5198701,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02590422535685372,"score_gpt":0.3018162174335818,"score_spread":0.2759119920767281,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}