{"id":"W2074156882","doi":"10.1109/slt.2012.6424163","title":"Realistic answer verification: An analysis of user errors in a sentence-repetition task","year":2012,"lang":"en","type":"article","venue":"","topic":"User Authentication and Security Systems","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Sentence; Task (project management); Repetition (rhetorical device); Imperfect; Simple (philosophy); Authentication (law); Word error rate; Natural language processing; Speech recognition; Artificial intelligence; Human–computer interaction; Computer security","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006897162,0.0008229021,0.0008295611,0.0009929801,0.000471081,0.0009562219,0.001021037,0.001482669,0.002066853],"category_scores_gemma":[0.1256561,0.0003786323,0.0004219607,0.0007082236,0.0006588594,0.001533277,0.001093313,0.0008115225,0.0008037772],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003878085,"about_ca_system_score_gemma":0.0004078156,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001542079,"about_ca_topic_score_gemma":0.001101617,"domain_scores_codex":[0.9876471,0.006654982,0.001497146,0.00133547,0.002511557,0.0003538267],"domain_scores_gemma":[0.7542408,0.2123416,0.01232502,0.01060988,0.009247119,0.001235497],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.02440381,0.003661556,0.2766486,0.00216035,0.0009430287,0.003483875,0.02685831,0.04088958,0.2933028,0.003179621,0.003816546,0.3206519],"study_design_scores_gemma":[0.0003537178,0.009163791,0.4403335,0.0001587738,0.0004217339,0.007024358,0.003778046,0.419556,0.1099869,0.004998423,0.003653398,0.0005713773],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9776418,0.00007640524,0.02084166,0.00004869947,0.00001360404,0.0001290583,0.0001976635,0.0004185459,0.0006326569],"genre_scores_gemma":[0.9894135,0.00003383348,0.009155142,0.0000511891,0.000009588309,0.0001069239,0.0005601331,0.0001397185,0.0005299227],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.006897162,"threshold_uncertainty_score":0.03647614,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02646676874574957,"score_gpt":0.281795902712501,"score_spread":0.2553291339667514,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}