{"id":"W4406209209","doi":"10.2139/ssrn.5024095","title":"Reinforcement Learning in Non-Markov Market-Making","year":2025,"lang":"en","type":"preprint","venue":"SSRN Electronic Journal","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":false,"ca_institutions":"University of Calgary","funders":"","keywords":"Reinforcement learning; Computer science; Markov decision process; Mathematical optimization; Maximization; Artificial intelligence; Limit (mathematics); Markov process; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","research_integrity"],"consensus_categories":[],"category_scores_codex":[0.005784168,0.0005729651,0.0006393453,0.001017655,0.0003540561,0.0006889888,0.003317931,0.0004215481,0.00004705197],"category_scores_gemma":[0.0004256864,0.0006006359,0.0003348043,0.0006447955,0.00004513539,0.0004480529,0.003013681,0.01513323,0.00002834738],"about_ca_system_candidate":true,"about_ca_system_consensus":true,"about_ca_system_score_codex":0.004617254,"about_ca_system_score_gemma":0.007770895,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00007076726,"about_ca_topic_score_gemma":0.0001187025,"domain_scores_codex":[0.992662,0.0003741508,0.001168885,0.0007892268,0.0009405027,0.00406527],"domain_scores_gemma":[0.9975672,0.0002401227,0.0009629678,0.0009316793,0.0001915016,0.0001064682],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00002526916,0.00001871936,0.001345685,0.00008374688,0.0001855678,0.00002751627,0.000422203,0.9376694,0.000005344607,0.03070844,0.0002168498,0.02929123],"study_design_scores_gemma":[0.0007502625,0.0002576695,0.0004767612,0.0012421,0.00003900759,0.0001164397,0.0003010668,0.9585044,0.00001150979,0.03437446,0.003238751,0.0006875429],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0005407828,0.0009906428,0.953092,0.000802635,0.001437308,0.0004165801,2.26981e-7,0.0001560651,0.04256374],"genre_scores_gemma":[0.940548,0.005884337,0.008609671,0.0003051968,0.0003512583,0.00004154883,0.00000894476,0.00004342266,0.04420761],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.9444823,"threshold_uncertainty_score":0.9996445,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.008008819207830534,"score_gpt":0.2608087152248799,"score_spread":0.2527998960170494,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}