{"id":"W7082252666","doi":"10.48448/jjkr-0706","title":"Navigating the Prompt Space: Supervision Matters in CoT When Reasoning Misleads","year":2025,"lang":"en","type":"other","venue":"Underline Science Inc.","topic":"Topic Modeling","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Task (project management); Forcing (mathematics); Function (biology); Architecture; Foundation (evidence); State (computer science); Trajectory; SAFER","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008752737,0.001264554,0.001163305,0.0006792438,0.001181636,0.004249207,0.002013643,0.002529169,0.005899671],"category_scores_gemma":[0.09096234,0.0009858523,0.001187334,0.0006696127,0.002916004,0.01160798,0.004480085,0.005399108,0.001489905],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001476314,"about_ca_system_score_gemma":0.003547612,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004246028,"about_ca_topic_score_gemma":0.004459471,"domain_scores_codex":[0.9938567,0.002516035,0.0004439055,0.001649169,0.001122144,0.000412036],"domain_scores_gemma":[0.9415032,0.0403365,0.003752666,0.01006048,0.002760946,0.00158621],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.003842443,0.001307654,0.0658092,0.00187548,0.000243883,0.001801864,0.01631005,0.1135313,0.05189032,0.1175317,0.01783015,0.608026],"study_design_scores_gemma":[0.0002993108,0.0006295055,0.005953838,0.0002745533,0.0001769558,0.0008754141,0.002584244,0.6569973,0.02485421,0.2941454,0.01306384,0.0001454879],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2041846,0.0007623108,0.7707949,0.003569066,0.0001675955,0.0002669519,0.0004614583,0.01093218,0.008861072],"genre_scores_gemma":[0.787102,0.0002570331,0.2083251,0.000879848,0.00005078331,0.0001365616,0.0006255375,0.0008759783,0.001747214],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.008752737,"threshold_uncertainty_score":0.04628944,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01589680592780121,"score_gpt":0.2887288984631789,"score_spread":0.2728320925353777,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}