{"id":"W7137121728","doi":"10.1109/phm-xian66756.2025.11427646","title":"How Much Confidence Do We Have for GenAI-Based Reasoningƒ A Statistical Inference Perspective for Reliability Estimation","year":2025,"lang":"","type":"article","venue":"","topic":"Software Reliability and Analysis Research","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Future Earth","funders":"","keywords":"Reliability (semiconductor); Perspective (graphical); Fiducial inference; Statistical inference; Estimation; Inference; Interval estimation; Point estimation","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1034925,0.001997696,0.003007946,0.002483354,0.001292607,0.008536728,0.004853045,0.004043935,0.003669886],"category_scores_gemma":[0.483974,0.001302098,0.002489621,0.001851891,0.006390631,0.01460222,0.003946597,0.007930645,0.0008307874],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002719583,"about_ca_system_score_gemma":0.003457299,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004124341,"about_ca_topic_score_gemma":0.003513261,"domain_scores_codex":[0.927676,0.04739604,0.003533038,0.009653964,0.01024238,0.001498606],"domain_scores_gemma":[0.3820154,0.5484765,0.01845965,0.03634647,0.0127007,0.002001284],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.003000293,0.000722545,0.05480966,0.001930933,0.002239633,0.0005744359,0.007304431,0.332709,0.007838172,0.39111,0.00440918,0.1933517],"study_design_scores_gemma":[0.0001906715,0.0004728562,0.005570548,0.0004574333,0.0002698028,0.000238897,0.001042117,0.5220804,0.004272047,0.4626364,0.002596818,0.000172045],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.07973729,0.0008564494,0.9090469,0.005016679,0.0001699185,0.0001454735,0.0004359165,0.0007806007,0.003810755],"genre_scores_gemma":[0.7585397,0.0004186943,0.2378149,0.001449677,0.0001693954,0.0003279204,0.0005141646,0.0002617452,0.0005038904],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.1034925,"threshold_uncertainty_score":0.5473272,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03371601620258263,"score_gpt":0.3781302341616838,"score_spread":0.3444142179591012,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}