{"id":"W4416034102","doi":"10.18653/v1/2025.findings-emnlp.838","title":"LLMs for Bayesian Optimization in Scientific Domains: Are We There Yet?","year":2025,"lang":"","type":"article","venue":"","topic":"Advanced Multi-Objective Optimization Algorithms","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Natural Sciences and Engineering Research Council of Canada; Canadian Institute for Advanced Research","keywords":"Bayesian probability; Key (lock); Bayesian inference; Bayesian optimization","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008854064,0.001053217,0.00158489,0.0005840456,0.0005946202,0.002253728,0.002590531,0.002348028,0.004470298],"category_scores_gemma":[0.03943722,0.0007953581,0.0008907719,0.0006800577,0.002463554,0.003240386,0.002859927,0.004448283,0.00146348],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001993316,"about_ca_system_score_gemma":0.002772961,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002605627,"about_ca_topic_score_gemma":0.004857035,"domain_scores_codex":[0.9958197,0.00281164,0.0001393561,0.0004939398,0.0006205351,0.000114842],"domain_scores_gemma":[0.9834889,0.0128606,0.0007710166,0.001723986,0.0007071579,0.0004483743],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0005118233,0.0002444553,0.001672465,0.0005898738,0.0001990779,0.00008159058,0.0002856392,0.6912615,0.00389978,0.1159552,0.005746942,0.1795517],"study_design_scores_gemma":[0.00006377816,0.00004522471,0.0001080967,0.00003021019,0.00001231886,0.0000120648,0.00001798309,0.8977625,0.001153072,0.09814065,0.002637621,0.0000164635],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.007445728,0.0007227695,0.9863867,0.001479793,0.00005623295,0.00007221899,0.00008332181,0.001973172,0.001780114],"genre_scores_gemma":[0.2750127,0.0007084781,0.718918,0.001579946,0.0001440088,0.0006269102,0.0002681075,0.0007281082,0.002013776],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.008854064,"threshold_uncertainty_score":0.04682529,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01814474607173039,"score_gpt":0.2931597976741683,"score_spread":0.2750150516024379,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}