{"id":"W4414055490","doi":"10.36227/techrxiv.175735299.97215847/v1","title":"Responsible Agentic Reasoning and AI Agents: A Critical Survey","year":2025,"lang":"en","type":"article","venue":"","topic":"Logic, Reasoning, and Knowledge","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Vector Institute","funders":"HORIZON EUROPE Framework Programme","keywords":"Trustworthiness; Audit; Perception; Knowledge representation and reasoning; Automated reasoning","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0009855978,0.0001240328,0.0001684954,0.0001432374,0.0002092381,0.0003735162,0.0004589027,0.00007012537,0.00007432768],"category_scores_gemma":[0.002051837,0.0001041507,0.0000404337,0.0005767674,0.00008980061,0.0003355826,0.0004851349,0.0001346969,0.00008129489],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00002941053,"about_ca_system_score_gemma":0.0001831819,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001553936,"about_ca_topic_score_gemma":0.0001923171,"domain_scores_codex":[0.9986364,0.0002868561,0.0001742667,0.0004354977,0.0001402552,0.0003267702],"domain_scores_gemma":[0.9985992,0.0006778068,0.0000181763,0.0004362079,0.0001479705,0.000120669],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"observational","study_design_scores_codex":[0.00001448453,0.00006688853,0.02520095,0.00002635076,0.00001797782,0.00003011491,0.0002844322,0.000001114263,0.00007312438,0.9438951,0.02526336,0.005126108],"study_design_scores_gemma":[0.001093058,0.0001838924,0.7867171,0.0002205095,0.00003350707,0.00005103,0.00008833436,0.1134454,0.001749533,0.06943188,0.02636087,0.0006249551],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.03352104,0.00107745,0.818279,0.003160702,0.000919593,0.0001650784,0.000002082568,0.0003712368,0.1425039],"genre_scores_gemma":[0.9680545,0.00002969022,0.01476848,0.001872785,0.00002461247,0.00000828796,0.000001611803,0.000005281212,0.01523474],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9345335,"threshold_uncertainty_score":0.4247142,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02580318371401292,"score_gpt":0.3263356991621448,"score_spread":0.3005325154481319,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}