{"id":"W4416447818","doi":"10.48550/arxiv.2505.16217","title":"Reward-Aware Proto-Representations in Reinforcement Learning","year":2025,"lang":"en","type":"preprint","venue":"ArXiv.org","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Alliance de recherche numérique du Canada; Alberta Innovates; Natural Sciences and Engineering Research Council of Canada; Canadian Institute for Advanced Research","keywords":"Representation (politics); Reinforcement learning; Space (punctuation); Function (biology); Key (lock); Successor cardinal; Encoding (memory)","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00163505,0.0004803226,0.0007965633,0.0004636837,0.0003107542,0.0009604617,0.001286698,0.001079109,0.002701214],"category_scores_gemma":[0.007030292,0.0003089245,0.0004649241,0.000602353,0.001552664,0.002580364,0.001106244,0.001913641,0.0003563839],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001176977,"about_ca_system_score_gemma":0.0008444589,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001312699,"about_ca_topic_score_gemma":0.001666632,"domain_scores_codex":[0.9993215,0.0003516839,0.00002784877,0.0001343333,0.0001016726,0.00006302989],"domain_scores_gemma":[0.9975922,0.001550814,0.0002048824,0.0003477767,0.0001777688,0.000126562],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001808266,0.0001025354,0.0009850343,0.0001192975,0.00003274089,0.00006802851,0.0001756532,0.6322062,0.001397998,0.2874132,0.001814591,0.07550392],"study_design_scores_gemma":[0.00001397355,0.0000308837,0.00006138368,0.00001018924,0.000003390276,0.00001285605,0.000008926755,0.8987359,0.000181388,0.1004834,0.0004514055,0.00000615984],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.04321694,0.0003986736,0.9523542,0.0005254388,0.00003982242,0.00003060171,0.0001111781,0.0004911524,0.002832049],"genre_scores_gemma":[0.8401144,0.0003136562,0.1559829,0.000191156,0.0000416517,0.000144517,0.000199291,0.000104156,0.002908219],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.002701214,"threshold_uncertainty_score":0.009036481,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05062451241968759,"score_gpt":0.318504177632027,"score_spread":0.2678796652123395,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}