{"id":"W4415158403","doi":"10.48550/arxiv.2504.09858","title":"Reasoning Models Can Be Effective Without Thinking","year":2025,"lang":"en","type":"preprint","venue":"ArXiv.org","topic":"Logic, Reasoning, and Knowledge","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"University of Toronto","keywords":"Simple (philosophy); Thinking processes; Set (abstract data type); Latency (audio); Process (computing); Scaling; Automated reasoning; Analytic reasoning","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003289013,0.001509429,0.0008485035,0.0007298103,0.0006650612,0.003426973,0.002131827,0.001263262,0.0122513],"category_scores_gemma":[0.02264021,0.000837336,0.001627072,0.0008126275,0.00190748,0.0101619,0.004478728,0.003796035,0.004971867],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001331987,"about_ca_system_score_gemma":0.002281473,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001746397,"about_ca_topic_score_gemma":0.003866628,"domain_scores_codex":[0.996645,0.001115368,0.0002516684,0.0008985421,0.0008314785,0.0002579878],"domain_scores_gemma":[0.987792,0.006042254,0.0004723882,0.004926919,0.0005004231,0.0002659129],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.001048712,0.000408691,0.00417378,0.001077033,0.0001970773,0.0002881304,0.0007321473,0.07986996,0.02806202,0.07452364,0.03275239,0.7768664],"study_design_scores_gemma":[0.0002573147,0.0002725717,0.0009612493,0.0001273857,0.0001519423,0.0003100559,0.0002926779,0.5767156,0.03446503,0.347485,0.03889215,0.00006903005],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.09059335,0.001577576,0.8327512,0.004888504,0.0004407623,0.0003840556,0.001323051,0.04894798,0.01909353],"genre_scores_gemma":[0.5274956,0.0005910281,0.4589547,0.001534428,0.0001715284,0.0003062061,0.002629454,0.00168397,0.006633122],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.0122513,"threshold_uncertainty_score":0.04098463,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03665691938393383,"score_gpt":0.2781942094752528,"score_spread":0.241537290091319,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}