{"id":"W4416524723","doi":"10.48550/arxiv.2507.00275","title":"Deep Double Q-learning","year":2025,"lang":"en","type":"preprint","venue":"ArXiv.org","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Alliance de recherche numérique du Canada; Alberta Innovates; Natural Sciences and Engineering Research Council of Canada; Canadian Institute for Advanced Research","keywords":"Reinforcement learning; Deep learning; Double loop; Double-precision floating-point format; Carry (investment); Double layered; Double layer (biology); Key (lock)","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003596204,0.0012888,0.001602419,0.0005654524,0.000587103,0.00134142,0.002720965,0.00146289,0.004906695],"category_scores_gemma":[0.01158116,0.0006681793,0.0005962808,0.0005441508,0.001715895,0.001898504,0.002550564,0.002471686,0.001066513],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001414825,"about_ca_system_score_gemma":0.002697408,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004559655,"about_ca_topic_score_gemma":0.004687452,"domain_scores_codex":[0.9980593,0.0006054699,0.0001203244,0.0005821014,0.0003774435,0.0002553908],"domain_scores_gemma":[0.9945611,0.002967854,0.0004036759,0.0007495268,0.001040888,0.0002769092],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000367139,0.0002109832,0.002507451,0.0002239704,0.0001147212,0.0000969257,0.00013937,0.6802584,0.003695225,0.03546547,0.005155716,0.2717646],"study_design_scores_gemma":[0.00002308103,0.00005176651,0.00008604182,0.000009761236,0.000006434247,0.00001371007,0.000005009348,0.9883015,0.0008342961,0.01003442,0.0006281091,0.000005923884],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.01026998,0.0002319195,0.9863344,0.000227436,0.00006627835,0.0000658721,0.00005238331,0.001019657,0.001732054],"genre_scores_gemma":[0.6702394,0.0002089284,0.3225187,0.0006731273,0.00008798107,0.0003686851,0.0003404068,0.0003082014,0.005254561],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.004906695,"threshold_uncertainty_score":0.01901877,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04371311942963686,"score_gpt":0.2866334611570382,"score_spread":0.2429203417274013,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}