{"id":"W4252297965","doi":"10.2139/ssrn.3901432","title":"A Reinforcement Learning Model of Procedural Rationality","year":2021,"lang":"en","type":"article","venue":"SSRN Electronic Journal","topic":"Advanced Research in Systems and Signal Processing","field":"Engineering","cited_by":0,"is_retracted":false,"has_abstract":false,"ca_institutions":"Brock University","funders":"","keywords":"Rationality; Reinforcement learning; Reinforcement; Psychology; Computer science; Mathematical economics; Artificial intelligence; Cognitive psychology; Economics; Social psychology; Epistemology; Philosophy","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001889029,0.0005453723,0.0007931617,0.0004364993,0.0005478734,0.002510597,0.002141092,0.002275451,0.009195284],"category_scores_gemma":[0.01079961,0.0004320603,0.000727697,0.0005148746,0.002000074,0.003168343,0.001006197,0.002364389,0.000893006],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001935056,"about_ca_system_score_gemma":0.001836263,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005827717,"about_ca_topic_score_gemma":0.00373192,"domain_scores_codex":[0.9987172,0.0006846433,0.00004532461,0.0002053908,0.0002021225,0.0001453142],"domain_scores_gemma":[0.9949185,0.003540162,0.0003709767,0.0004558899,0.0004350302,0.0002793598],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00006142168,0.00006582035,0.0006005968,0.00002777234,0.00003025244,0.0001033652,0.0001425974,0.1227433,0.0004084293,0.8650669,0.001316037,0.00943342],"study_design_scores_gemma":[0.00003789075,0.00002306279,0.0001828615,0.000007132904,0.00000873695,0.00002577201,0.00002386465,0.3577532,0.00008247617,0.6410958,0.0007470384,0.00001223387],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1046056,0.0002958064,0.8192497,0.00578086,0.0001168195,0.00008319779,0.0003418738,0.0003898262,0.06913622],"genre_scores_gemma":[0.9514624,0.0001624459,0.03503647,0.0002313962,0.00006374373,0.0000715153,0.00008717097,0.00004057377,0.01284425],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.009195284,"threshold_uncertainty_score":0.03076136,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01635224693011702,"score_gpt":0.2635554947981743,"score_spread":0.2472032478680572,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}