{"id":"W4251115000","doi":"10.1145/634126.634127","title":"On the reliability of usability testing","year":2001,"lang":"en","type":"article","venue":"CHI '01 extended abstracts on Human factors in computer systems - CHI '01","topic":"Software Engineering Techniques and Practices","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Carleton University","funders":"","keywords":"Usability; Dialog box; Usability lab; Computer science; Usability inspection; Reliability (semiconductor); Test (biology); Pluralistic walkthrough; System usability scale; Heuristic evaluation; Web usability; Usability engineering; Human–computer interaction; Knowledge management; World Wide Web","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.301217,0.000896118,0.001583873,0.007013924,0.002253019,0.004361262,0.002284766,0.003179319,0.001654783],"category_scores_gemma":[0.7183981,0.001153966,0.001748096,0.004054748,0.008157873,0.004898553,0.00403899,0.003222726,0.0009042348],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003857276,"about_ca_system_score_gemma":0.003512463,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004417361,"about_ca_topic_score_gemma":0.002804184,"domain_scores_codex":[0.4918967,0.3392847,0.03068198,0.01674389,0.1173778,0.004015011],"domain_scores_gemma":[0.08520907,0.7778568,0.01714373,0.02554601,0.09260666,0.001637729],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.004640555,0.0005937821,0.6648917,0.002578311,0.001635745,0.0005530023,0.02374792,0.005185737,0.002777912,0.01732248,0.009067429,0.2670055],"study_design_scores_gemma":[0.0007979724,0.006686989,0.8375735,0.006488791,0.00165519,0.002248124,0.01131317,0.0506998,0.006900448,0.04040449,0.03473392,0.0004976654],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7195605,0.01652193,0.1696087,0.005202156,0.002428279,0.002865762,0.0009191025,0.0005496248,0.08234389],"genre_scores_gemma":[0.9794967,0.0008768782,0.01668039,0.0004476431,0.0003953523,0.0009378972,0.0003090005,0.0001306672,0.0007253001],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.698783,"threshold_uncertainty_score":0.8617239,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06489437810276194,"score_gpt":0.3004208260193693,"score_spread":0.2355264479166073,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}