{"id":"W4414746796","doi":"10.3390/sym17101632","title":"A Survey of Maximum Entropy-Based Inverse Reinforcement Learning: Methods and Applications","year":2025,"lang":"en","type":"article","venue":"Symmetry","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"Artificial Intelligence in Medicine (Canada)","funders":"","keywords":"Ambiguity; Reinforcement learning; Benchmark (surveying); Principle of maximum entropy; Matching (statistics); Inverse","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00126282,0.000129913,0.0002105131,0.0002992801,0.000114228,0.00006687015,0.0005226511,0.00007252272,0.00001368364],"category_scores_gemma":[0.0004424228,0.0001302167,0.00004642011,0.001070878,0.00009250328,0.0001160666,0.0003248117,0.000210174,0.00001204527],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00005047958,"about_ca_system_score_gemma":0.0001580051,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001276871,"about_ca_topic_score_gemma":0.000004015497,"domain_scores_codex":[0.9985995,0.0003215707,0.0003521655,0.0002957837,0.0002139382,0.0002169968],"domain_scores_gemma":[0.9984511,0.0005555729,0.0001895079,0.0005736153,0.0001628593,0.00006741226],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00002030153,0.0000570482,0.06662763,0.0002618791,0.0001221751,0.000001484072,0.0001635111,0.6824363,0.001185519,0.1577531,0.0007909897,0.09058003],"study_design_scores_gemma":[0.0005452492,0.0001254148,0.0183368,0.00003690299,0.00002036218,5.34881e-7,0.00002886989,0.9608366,0.003637938,0.000872127,0.01539454,0.0001646446],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0004034847,0.0001152514,0.9926715,0.0001448703,0.0001222104,0.0002718118,6.039601e-7,0.00009013002,0.006180072],"genre_scores_gemma":[0.6831983,0.00002766977,0.3135924,0.0005152484,0.00001506157,0.00005523432,0.00002502692,0.00001194928,0.002559103],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.6827949,"threshold_uncertainty_score":0.5310083,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02304166197990325,"score_gpt":0.322562583324321,"score_spread":0.2995209213444178,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}