{"id":"W2771158352","doi":"10.1002/smr.1925","title":"Evaluating Pred(<i>p</i>) and standardized accuracy criteria in software development effort estimation","year":2017,"lang":"en","type":"article","venue":"Journal of Software Evolution and Process","topic":"Software Engineering Research","field":"Computer Science","cited_by":56,"is_retracted":false,"has_abstract":true,"ca_institutions":"École de Technologie Supérieure","funders":"","keywords":"Measure (data warehouse); Consistency (knowledge bases); Software; Computer science; Estimation; Statistics; Data mining; Mathematics; Artificial intelligence","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05378008,0.0009705195,0.001005274,0.008352847,0.0005229658,0.003735346,0.001104202,0.00188633,0.0005577483],"category_scores_gemma":[0.274953,0.0004324647,0.0009866059,0.007340463,0.001572532,0.003523544,0.002301206,0.001246072,0.0002162465],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001165883,"about_ca_system_score_gemma":0.001952768,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003790436,"about_ca_topic_score_gemma":0.002540404,"domain_scores_codex":[0.9480471,0.02809856,0.006915468,0.003549837,0.01238485,0.001004196],"domain_scores_gemma":[0.5195221,0.3898836,0.04548568,0.01504744,0.02784026,0.002220918],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0006416901,0.0003049134,0.7570458,0.0004431107,0.001000818,0.0001287878,0.0005981181,0.08456271,0.001742524,0.004794777,0.0009698385,0.1477667],"study_design_scores_gemma":[0.00007707394,0.001774088,0.3541366,0.0003187282,0.0003635363,0.0003872722,0.0008383669,0.6209708,0.008272384,0.01116623,0.001513793,0.0001810358],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7859913,0.001553048,0.2073175,0.0003256982,0.00006079452,0.0002304901,0.0006526311,0.0006022826,0.003266205],"genre_scores_gemma":[0.9632674,0.0001240509,0.03585247,0.00002904043,0.00002036845,0.0001238247,0.0004231877,0.00003218907,0.0001275309],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.05378008,"threshold_uncertainty_score":0.2844197,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03990346991028516,"score_gpt":0.3796051154684074,"score_spread":0.3397016455581222,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}