{"id":"W6947887187","doi":"10.48448/0fpe-gv41","title":"Confidence Under the Hood: An Investigation into the Confidence-Probability Alignment in Large Language Models","year":2024,"lang":"en","type":"other","venue":"Underline Science Inc.","topic":"Species Distribution and Climate Change","field":"Environmental Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Brock University","funders":"","keywords":"Reliability (semiconductor); Range (aeronautics); Language model; Work (physics); Language understanding; Confidence interval","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.04819138,0.001097994,0.001176405,0.002898996,0.001641176,0.006764591,0.001863017,0.001360423,0.003510036],"category_scores_gemma":[0.3514473,0.001060896,0.001241126,0.00353216,0.003743435,0.01047905,0.006302498,0.004221316,0.0006066944],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00248407,"about_ca_system_score_gemma":0.002154823,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006222985,"about_ca_topic_score_gemma":0.003954429,"domain_scores_codex":[0.960255,0.02895942,0.001825986,0.004081661,0.004168852,0.0007091933],"domain_scores_gemma":[0.4810035,0.4594772,0.02226464,0.02358761,0.01144352,0.002223485],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00268216,0.0009578103,0.4137582,0.0008958128,0.001168449,0.0008290225,0.0351576,0.1701934,0.005793363,0.1428441,0.005847422,0.2198727],"study_design_scores_gemma":[0.00005805895,0.0003945479,0.03892436,0.0001205216,0.000109493,0.0003498626,0.002748141,0.8520396,0.002826401,0.0993718,0.002913944,0.0001431735],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.5246763,0.0005132355,0.4608979,0.002365074,0.00008465209,0.0002560979,0.0005534959,0.001555195,0.009098119],"genre_scores_gemma":[0.957991,0.00008265142,0.04059739,0.0001552658,0.0000408733,0.0001317583,0.0004329555,0.0002045268,0.0003635324],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.04819138,"threshold_uncertainty_score":0.2548634,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03851609725265768,"score_gpt":0.297084339083671,"score_spread":0.2585682418310133,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}