{"id":"W2572009727","doi":"","title":"Bias in algorithm portfolio performance evaluation","year":2016,"lang":"en","type":"article","venue":"International Joint Conference on Artificial Intelligence","topic":"Constraint Satisfaction and Optimization","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Solver; Computer science; Portfolio; Measure (data warehouse); Algorithm; Data mining","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.0008711398,0.0001824072,0.0001538209,0.0005070918,0.00006708644,0.0001991231,0.0006174007,0.00007926871,0.001992664],"category_scores_gemma":[0.0003402191,0.0001443688,0.00006436353,0.0003655323,0.00009369105,0.0008806466,0.0001064372,0.0001454396,0.0008088615],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002837785,"about_ca_system_score_gemma":0.000239815,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00003203758,"about_ca_topic_score_gemma":0.00006112862,"domain_scores_codex":[0.9976629,0.0001116432,0.0006214669,0.0005208,0.0008239397,0.0002592736],"domain_scores_gemma":[0.9986564,0.0001176345,0.0002043832,0.0003494754,0.000583156,0.00008897857],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00001023185,0.00005977813,0.0005499911,7.454846e-7,0.000006063402,0.000005272578,0.0001017789,0.0007698804,0.0009116835,0.1836926,0.00003233053,0.8138596],"study_design_scores_gemma":[0.0001284265,0.00009744522,0.009628385,0.0001765614,0.000002857879,0.00001778659,0.00007107798,0.9181352,0.03321419,0.03788223,0.0003664859,0.0002792939],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02856109,0.00000506579,0.9471118,0.006277655,0.001549397,0.0002776771,0.00000785618,0.0001185678,0.01609084],"genre_scores_gemma":[0.9868424,0.0001301192,0.0123046,0.0002922596,0.0000951957,0.00005415718,0.000006855575,0.000007913838,0.0002665308],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9582813,"threshold_uncertainty_score":0.9999691,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1751941516819778,"score_gpt":0.3382325530106571,"score_spread":0.1630384013286794,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}