{"id":"W7106480312","doi":"10.1609/aaaiss.v7i1.36923","title":"Fine-Tuning Large Language Models for Structured ClinicalReport Generation Using GRPO","year":2025,"lang":"","type":"article","venue":"Proceedings of the AAAI Symposium Series","topic":"Topic Modeling","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"International Institute for Sustainable Development; Western University","funders":"","keywords":"Relevance (law); Adaptation (eye); Language model; Disk formatting; Medical care; Baseline (sea); Complement (music); English language","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.001299936,0.0004209953,0.0006409287,0.0001888035,0.0007798676,0.0005498878,0.001711908,0.0002989786,0.000006655033],"category_scores_gemma":[0.0003933834,0.0003589586,0.0003798658,0.0007008818,0.0001655959,0.002055355,0.001433864,0.0003427025,4.512858e-7],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001331641,"about_ca_system_score_gemma":0.0004026462,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0000523973,"about_ca_topic_score_gemma":0.0000259682,"domain_scores_codex":[0.9964972,0.0000265099,0.001375171,0.0009438851,0.0005046918,0.0006525],"domain_scores_gemma":[0.9971794,0.00007740769,0.001054561,0.0006223941,0.0009784155,0.00008778368],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"bench_or_experimental","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001260656,0.0001035052,0.002441492,0.001114413,0.0002045835,0.000001086213,0.009651897,0.01679675,0.7171715,0.249856,0.0006280935,0.001904579],"study_design_scores_gemma":[0.0005767926,0.00007454055,0.00005226682,0.0003775297,0.0001801301,0.00001968356,0.0004106749,0.8263391,0.1594233,0.01193993,0.0003092148,0.0002968006],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6407669,0.0007530425,0.348167,0.004432353,0.003137825,0.001317582,0.00003751752,0.0001178519,0.001269968],"genre_scores_gemma":[0.9191872,0.00004102361,0.07770415,0.000303342,0.0005297564,0.00004337376,0.000003780645,0.00003345097,0.002153882],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.8095424,"threshold_uncertainty_score":0.9998862,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03647737372343484,"score_gpt":0.2966372792713703,"score_spread":0.2601599055479355,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}