{"id":"W7126171114","doi":"10.1109/icir68135.2025.11361598","title":"How Much Confidence Do We Have for GenAI-Based Reasoning for Reliability Estimation?","year":2025,"lang":"","type":"article","venue":"","topic":"Reliability and Maintenance Optimization","field":"Engineering","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Future Earth","funders":"Western New England University","keywords":"Weibull distribution; Robustness (evolution); Shape parameter; Reliability (semiconductor); Confidence interval; Scale parameter; Sample size determination; Estimation theory","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.09914777,0.002047139,0.002767342,0.002263413,0.001195736,0.008527362,0.005372974,0.00367705,0.003712003],"category_scores_gemma":[0.4439419,0.001338086,0.002301145,0.001738945,0.005384167,0.01443148,0.004340373,0.007146784,0.001083784],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003153672,"about_ca_system_score_gemma":0.003598492,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004261105,"about_ca_topic_score_gemma":0.003398592,"domain_scores_codex":[0.9277167,0.0449898,0.004027348,0.009342582,0.01227946,0.001644206],"domain_scores_gemma":[0.444312,0.4765718,0.01965306,0.03996681,0.01716259,0.002333771],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.004856736,0.0008313025,0.07300898,0.002284274,0.002497136,0.0005983326,0.006238855,0.4156085,0.006954982,0.2164052,0.006218457,0.2644973],"study_design_scores_gemma":[0.0002359126,0.0005215226,0.005267305,0.0004349353,0.0002511148,0.0002646502,0.001060452,0.723586,0.004336026,0.2611094,0.002763729,0.000168942],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1079593,0.001293169,0.8788101,0.004839347,0.0002115678,0.0001853903,0.0006048754,0.001338203,0.004758018],"genre_scores_gemma":[0.7980548,0.0004603224,0.1982232,0.001347296,0.0001590848,0.0002889595,0.0006607196,0.0002596436,0.0005460284],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.09914777,"threshold_uncertainty_score":0.5243498,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0101383198067567,"score_gpt":0.2580988885191923,"score_spread":0.2479605687124356,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}