{"id":"W4251115000","doi":"10.1145/634126.634127","title":"On the reliability of usability testing","year":2001,"lang":"en","type":"article","venue":"CHI '01 extended abstracts on Human factors in computer systems - CHI '01","topic":"Software Engineering Techniques and Practices","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Carleton University","funders":"","keywords":"Usability; Dialog box; Usability lab; Computer science; Usability inspection; Reliability (semiconductor); Test (biology); Pluralistic walkthrough; System usability scale; Heuristic evaluation; Web usability; Usability engineering; Human–computer interaction; Knowledge management; World Wide Web","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.002424026,0.0005810995,0.0007029005,0.0003031524,0.0003110145,0.0003966372,0.002169222,0.0002522477,0.00002585983],"category_scores_gemma":[0.0009494951,0.0004218138,0.0002115245,0.0007524322,0.0001550615,0.0006196189,0.0004034732,0.001074811,0.0000177375],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002583441,"about_ca_system_score_gemma":0.00007863952,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0008412096,"about_ca_topic_score_gemma":0.00003995021,"domain_scores_codex":[0.9956583,0.0004229019,0.001337545,0.001111389,0.0008095236,0.0006602988],"domain_scores_gemma":[0.9920474,0.004378612,0.0007428724,0.002506702,0.0001376704,0.0001866886],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"observational","study_design_scores_codex":[0.0003821549,0.01105412,0.1859023,0.002518422,0.0004762635,0.0006573794,0.01052682,0.4735053,0.001813442,0.2296009,0.01185306,0.07170981],"study_design_scores_gemma":[0.000708997,0.00127657,0.9159213,0.001143567,0.00001903219,0.00007699345,0.00004753077,0.06572797,0.001827419,0.009461347,0.002697901,0.001091402],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9271436,0.00004843984,0.06676333,0.0001723907,0.002110712,0.0008941431,0.00001158575,0.0009020628,0.001953675],"genre_scores_gemma":[0.9897559,0.000007184112,0.009643083,0.0001078982,0.0003678585,0.00004285854,0.000006869602,0.00003989655,0.00002841278],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.7300189,"threshold_uncertainty_score":0.9998234,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06489437810276194,"score_gpt":0.3004208260193693,"score_spread":0.2355264479166073,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}