{"id":"W2078504914","doi":"10.1145/634067.634127","title":"On the reliability of usability testing","year":2001,"lang":"en","type":"article","venue":"","topic":"Usability and User Interface Design","field":"Computer Science","cited_by":39,"is_retracted":false,"has_abstract":true,"ca_institutions":"Carleton University","funders":"","keywords":"Usability; Usability lab; Dialog box; Computer science; Usability inspection; Reliability (semiconductor); Heuristic evaluation; Test (biology); System usability scale; Pluralistic walkthrough; Usability engineering; Web usability; Human–computer interaction; Knowledge management; World Wide Web","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2947737,0.00101032,0.001676386,0.006450198,0.002300604,0.004295689,0.002272121,0.0032124,0.001656023],"category_scores_gemma":[0.7027363,0.001187686,0.001853747,0.003728309,0.008293359,0.004748529,0.004060988,0.003134752,0.0009314895],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00363809,"about_ca_system_score_gemma":0.003302166,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00412268,"about_ca_topic_score_gemma":0.002507726,"domain_scores_codex":[0.5038574,0.332063,0.03069664,0.01665506,0.1127781,0.00394972],"domain_scores_gemma":[0.09152894,0.7631108,0.01655436,0.02823939,0.09895839,0.001608066],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.005216573,0.0006675376,0.6367282,0.00300408,0.001749123,0.0006697436,0.02710049,0.006031313,0.004246838,0.01888359,0.00909273,0.2866097],"study_design_scores_gemma":[0.0008629272,0.00757273,0.8165736,0.006853501,0.001862229,0.002698797,0.01248323,0.05841435,0.01028853,0.04172527,0.0400795,0.0005852974],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6993157,0.01397712,0.1980847,0.004332573,0.002335888,0.003008992,0.0008382815,0.0006322156,0.07747462],"genre_scores_gemma":[0.9756089,0.000771067,0.02055667,0.0004120427,0.0003612213,0.001018493,0.000306583,0.0001597965,0.000805245],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.7052263,"threshold_uncertainty_score":0.8696696,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.07039233972694191,"score_gpt":0.2691552036774766,"score_spread":0.1987628639505347,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}