{"id":"W7126171114","doi":"10.1109/icir68135.2025.11361598","title":"How Much Confidence Do We Have for GenAI-Based Reasoning for Reliability Estimation?","year":2025,"lang":"","type":"article","venue":"","topic":"Reliability and Maintenance Optimization","field":"Engineering","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Future Earth","funders":"Western New England University","keywords":"Weibull distribution; Robustness (evolution); Shape parameter; Reliability (semiconductor); Confidence interval; Scale parameter; Sample size determination; Estimation theory","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.001249345,0.0004785922,0.0005995948,0.0001916381,0.0004659572,0.0005832982,0.0003529981,0.0004393084,0.00008407144],"category_scores_gemma":[0.005424045,0.0004930709,0.0003912693,0.0003984032,0.0001957025,0.0006165743,0.00004982061,0.0002447473,0.000004548339],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005389204,"about_ca_system_score_gemma":0.0004437717,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00003809504,"about_ca_topic_score_gemma":0.00004022102,"domain_scores_codex":[0.997266,0.00006400676,0.0007775495,0.0009200158,0.0002290749,0.0007433324],"domain_scores_gemma":[0.9959833,0.001606651,0.0001721624,0.0009617073,0.001134576,0.0001416108],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002683207,0.0001178356,0.0001375965,0.005172218,0.00007714392,3.196245e-7,0.0001902261,0.820949,0.0002625732,0.1423181,0.006359633,0.02414702],"study_design_scores_gemma":[0.001807202,0.0001605611,0.00005438351,0.001112122,0.0001692836,5.291956e-7,0.0005557769,0.9186091,0.01421693,0.04783627,0.01502301,0.000454777],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0006727809,0.001138339,0.9727003,0.01750203,0.001216953,0.004594679,0.0001158851,0.0003036704,0.001755339],"genre_scores_gemma":[0.5517862,0.0003387832,0.4412906,0.0001651467,0.00007589194,0.001098544,0.00006686887,0.00004840564,0.005129519],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.5511135,"threshold_uncertainty_score":0.9997521,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0101383198067567,"score_gpt":0.2580988885191923,"score_spread":0.2479605687124356,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}