{"id":"W4415974188","doi":"10.1016/j.procs.2025.09.549","title":"Content Safety and Response Quality in LLMs: A Data-Centric Refinement Approach","year":2025,"lang":"en","type":"article","venue":"Procedia Computer Science","topic":"Text Readability and Simplification","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université du Québec à Chicoutimi","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Readability; Performance improvement; Quality management; Quality (philosophy); Coherence (philosophical gambling strategy); Natural language generation","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008375165,0.001689161,0.001469327,0.00188471,0.0005670478,0.001969587,0.003452039,0.001674541,0.003080513],"category_scores_gemma":[0.02744381,0.0007457756,0.001850994,0.0009924216,0.001499065,0.004511925,0.003004684,0.00341549,0.002360961],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002076411,"about_ca_system_score_gemma":0.002990724,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007913541,"about_ca_topic_score_gemma":0.01162854,"domain_scores_codex":[0.9948794,0.002364552,0.0003941862,0.001127812,0.001017981,0.0002160922],"domain_scores_gemma":[0.9813944,0.009295258,0.001012019,0.004697044,0.003226258,0.0003750013],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.002039898,0.0007399185,0.01595411,0.001376311,0.000404916,0.0004567592,0.001237914,0.3689664,0.05239283,0.01443463,0.01907554,0.5229208],"study_design_scores_gemma":[0.00008536003,0.0003815613,0.001414555,0.0000624365,0.0001160525,0.0001309461,0.0001551471,0.9550723,0.01526056,0.01981414,0.007447748,0.00005925892],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.07253767,0.00158219,0.8950091,0.002752312,0.0002485045,0.0006894786,0.002650356,0.02155419,0.002976184],"genre_scores_gemma":[0.5558924,0.0004846848,0.4289707,0.001279293,0.0002035278,0.0006604524,0.006274531,0.001433035,0.004801431],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.008375165,"threshold_uncertainty_score":0.04429263,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.08154692548813655,"score_gpt":0.3217937313509582,"score_spread":0.2402468058628217,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}