{"id":"W7106841359","doi":"10.48448/57a4-tr42","title":"Can LLMs Truly Plan? A Comprehensive Evaluation of Planning Capabilities","year":2025,"lang":"","type":"other","venue":"Open MIND","topic":"","field":"","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Kootenay Association for Science & Technology","funders":"","keywords":"Benchmark (surveying); Representation (politics); Scenario planning; Strategic planning; Variety (cybernetics)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003384998,0.002123428,0.0007543769,0.001796726,0.0007463145,0.003937232,0.003064688,0.001865846,0.01974909],"category_scores_gemma":[0.02410167,0.0005458242,0.001498953,0.001857234,0.001217659,0.00551377,0.003131385,0.002746505,0.007799794],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002513018,"about_ca_system_score_gemma":0.003067484,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02584294,"about_ca_topic_score_gemma":0.03602201,"domain_scores_codex":[0.9972622,0.001013102,0.0001839404,0.0007577034,0.0005624787,0.0002206172],"domain_scores_gemma":[0.9909928,0.005551436,0.0002654136,0.002101043,0.0007131344,0.0003761407],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001798506,0.0006400865,0.02108828,0.003262002,0.0005708329,0.0004867219,0.000682699,0.2947294,0.002682677,0.03268879,0.4002213,0.2411487],"study_design_scores_gemma":[0.0004368772,0.0004045195,0.00532878,0.0006754372,0.0001814578,0.0003582739,0.001352587,0.7710114,0.007886828,0.06560008,0.1466348,0.0001291707],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.3163804,0.009087659,0.139094,0.009839986,0.002063287,0.001038936,0.2947644,0.07258552,0.1551458],"genre_scores_gemma":[0.529539,0.002061095,0.1126281,0.00147908,0.0001533527,0.0007301091,0.339844,0.003600262,0.009964955],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02584294,"threshold_uncertainty_score":0.06606722,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1435056458379813,"score_gpt":0.3896772012051527,"score_spread":0.2461715553671714,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}