{"id":"W7124295090","doi":"10.71781/34086","title":"Evaluating and improving mathematical reasoning in large language models via skill combinations","year":2025,"lang":"en","type":"dissertation","venue":"Open MIND","topic":"Topic Modeling","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Defense Advanced Research Projects Agency; Alliance de recherche numérique du Canada; National Science Foundation","keywords":"Context (archaeology); Subject (documents); Intentionality; Expected utility hypothesis","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005282732,0.002109518,0.001344115,0.001878794,0.0007150379,0.004127944,0.002851898,0.002003256,0.006965256],"category_scores_gemma":[0.0265983,0.0009813701,0.002593434,0.001266853,0.0008291621,0.007050855,0.003579542,0.002833595,0.00289609],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001918152,"about_ca_system_score_gemma":0.002131569,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008491139,"about_ca_topic_score_gemma":0.01602701,"domain_scores_codex":[0.9950937,0.002310622,0.0003148105,0.001150506,0.0009300394,0.0002003853],"domain_scores_gemma":[0.9842288,0.01206702,0.0005409968,0.001541342,0.001168991,0.0004528667],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001562264,0.00115665,0.01416455,0.001522826,0.0008133319,0.0004759896,0.001402311,0.2699506,0.01754983,0.00897888,0.01020083,0.672222],"study_design_scores_gemma":[0.0000979761,0.0003281755,0.001887128,0.00008048018,0.0002236019,0.00008905686,0.0002870944,0.9671578,0.007779365,0.01651716,0.005509193,0.00004282945],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2152321,0.00212072,0.7403829,0.001581092,0.0002170238,0.0006529572,0.002311116,0.02583269,0.01166945],"genre_scores_gemma":[0.5859652,0.0005872702,0.4002482,0.0004853388,0.00007614744,0.0004887956,0.006091389,0.0008481783,0.005209478],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.008491139,"threshold_uncertainty_score":0.02793807,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04240423615353835,"score_gpt":0.3769850964572031,"score_spread":0.3345808603036647,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}