{"id":"W4396802056","doi":"10.1145/3630106.3658941","title":"\"I'm Not Sure, But...\": Examining the Impact of Large Language Models' Uncertainty Expression on User Reliance and Trust","year":2024,"lang":"en","type":"preprint","venue":"","topic":"Topic Modeling","field":"Computer Science","cited_by":105,"is_retracted":false,"has_abstract":true,"ca_institutions":"Microsoft (Canada)","funders":"Microsoft Research; Universitas Brawijaya; National Science Foundation","keywords":"Scale (ratio); Task (project management); Natural experiment; Expression (computer science); Psychology; Perspective (graphical); Computer science; Social psychology; Cognitive psychology; Artificial intelligence; Medicine; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01385804,0.0005542659,0.0003884805,0.0003801206,0.0005018368,0.002030285,0.0005867003,0.0008068318,0.001386449],"category_scores_gemma":[0.1073319,0.0004032877,0.0004281413,0.0002427924,0.00121354,0.003141583,0.001259192,0.001123167,0.0003069648],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005845724,"about_ca_system_score_gemma":0.0005540554,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001465354,"about_ca_topic_score_gemma":0.001450392,"domain_scores_codex":[0.9894874,0.008306937,0.0004760946,0.0006427615,0.0008533554,0.0002333792],"domain_scores_gemma":[0.8086087,0.167128,0.01392362,0.005849748,0.003345453,0.001144551],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.011877,0.003135166,0.4181747,0.00355015,0.0008203411,0.001289731,0.1807651,0.01097121,0.1334572,0.006609154,0.002577114,0.2267731],"study_design_scores_gemma":[0.001033122,0.01603194,0.6440717,0.001192967,0.001895451,0.002512923,0.06073117,0.1441736,0.08970945,0.02138068,0.01613849,0.001128526],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.995145,0.00007646298,0.003799029,0.0001574006,0.000005418085,0.00002925807,0.00002747267,0.00006194778,0.0006978966],"genre_scores_gemma":[0.9963051,0.00004481829,0.003278443,0.0001122442,0.000006689273,0.00004801624,0.00003353212,0.0000206938,0.0001504578],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01385804,"threshold_uncertainty_score":0.07328916,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04877756425759006,"score_gpt":0.3127205170671762,"score_spread":0.2639429528095861,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}