{"id":"W7133211079","doi":"10.1109/ocit66168.2025.11399871","title":"The Calibration Gap: Model-Specific Confidence Thresholds for Reliable Customer Service LLMs","year":2025,"lang":"","type":"article","venue":"","topic":"Software System Performance and Reliability","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Marriott International (Canada)","funders":"","keywords":"Reliability (semiconductor); Calibration; Service (business); Benchmark (surveying); Quality (philosophy); Automation; Service quality; Customer satisfaction","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03974402,0.001379548,0.001524199,0.002816751,0.001090012,0.00595732,0.002834342,0.003255759,0.002743084],"category_scores_gemma":[0.2715971,0.0009675043,0.001352722,0.001940204,0.002790737,0.007783618,0.005621057,0.005263133,0.0005319968],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003548078,"about_ca_system_score_gemma":0.002888912,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006718978,"about_ca_topic_score_gemma":0.005039586,"domain_scores_codex":[0.9663818,0.01695998,0.001950076,0.003657574,0.009307461,0.001743068],"domain_scores_gemma":[0.7406644,0.2001152,0.01466978,0.02803383,0.01367386,0.00284304],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00228526,0.0006020613,0.06959633,0.0004899706,0.0003967235,0.0003299773,0.002433554,0.734841,0.004972327,0.05606302,0.007120267,0.1208696],"study_design_scores_gemma":[0.0001014055,0.0004069197,0.009289739,0.0001515045,0.0000736048,0.0001836764,0.0006027923,0.932161,0.007980314,0.04673604,0.002208954,0.0001040214],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.5665306,0.001491301,0.4058585,0.003527238,0.0001494988,0.0003356382,0.001338167,0.006575894,0.01419316],"genre_scores_gemma":[0.9498515,0.00006336722,0.04876392,0.0002106517,0.00002122095,0.00007973348,0.0004479644,0.0002708219,0.0002908361],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.03974402,"threshold_uncertainty_score":0.210189,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03205379937130462,"score_gpt":0.2816373459233823,"score_spread":0.2495835465520777,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}