{"id":"W4416095464","doi":"10.48550/arxiv.2505.04666","title":"Fine-Tuning Large Language Models and Evaluating Retrieval Methods for Improved Question Answering on Building Codes","year":2025,"lang":"en","type":"preprint","venue":"ArXiv.org","topic":"Topic Modeling","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Context (archaeology); Language model; Question answering; Code (set theory); Key (lock); Protocol (science); Adaptation (eye)","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009238964,0.002225118,0.001557591,0.002373321,0.0007225602,0.001894548,0.00295482,0.002069328,0.002500707],"category_scores_gemma":[0.02902545,0.0005298647,0.001973358,0.001395618,0.0009199805,0.00470218,0.001736639,0.003033007,0.001826179],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001848727,"about_ca_system_score_gemma":0.002017209,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01903394,"about_ca_topic_score_gemma":0.01958685,"domain_scores_codex":[0.9936873,0.003348576,0.0005482232,0.001421084,0.0007009798,0.0002937794],"domain_scores_gemma":[0.9790044,0.01696196,0.0005256477,0.001737313,0.001460565,0.0003101318],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.002600262,0.002597445,0.009625354,0.003529592,0.0007688402,0.0006219877,0.001656638,0.2286749,0.05404207,0.003128236,0.024758,0.6679966],"study_design_scores_gemma":[0.0004128341,0.0009900897,0.004125151,0.0001058674,0.000264663,0.0003332985,0.0007700996,0.9590251,0.02429157,0.002676283,0.006889029,0.0001159834],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6088455,0.008546866,0.3326478,0.002089876,0.000664603,0.002234109,0.00514276,0.0324005,0.007428083],"genre_scores_gemma":[0.6757151,0.001518779,0.2962585,0.001062025,0.0002432095,0.001067389,0.01965527,0.0008889008,0.003590832],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01903394,"threshold_uncertainty_score":0.04886085,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1026808830208773,"score_gpt":0.4276200098373957,"score_spread":0.3249391268165183,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}