{"id":"W4400450746","doi":"10.31219/osf.io/mru2x","title":"Attention Mechanism, Transformers, BERT, and GPT: Tutorial and Survey","year":2024,"lang":"en","type":"preprint","venue":"","topic":"Explainable Artificial Intelligence (XAI)","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"","keywords":"Transformer; Encoder; Computer science; Generative grammar; Artificial intelligence; Speech recognition; Electrical engineering; Voltage; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001087166,0.001431135,0.001027997,0.001978422,0.0004537429,0.001967681,0.001711959,0.001384557,0.008007152],"category_scores_gemma":[0.002695429,0.000838306,0.0008828961,0.003442155,0.001796473,0.005878404,0.001388511,0.002750599,0.003061444],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00183707,"about_ca_system_score_gemma":0.001236568,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003128615,"about_ca_topic_score_gemma":0.001773738,"domain_scores_codex":[0.9995585,0.00009032479,0.00004254967,0.0001421537,0.0001157861,0.00005066457],"domain_scores_gemma":[0.9994084,0.000363312,0.0000366317,0.00008870781,0.00007708582,0.00002595962],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00004975995,0.00007017573,0.0007894808,0.001239107,0.00005374308,0.0001993497,0.0003211288,0.009013428,0.00210491,0.5556909,0.01835676,0.4121112],"study_design_scores_gemma":[0.00001619251,0.000129122,0.001328382,0.000520927,0.0001128129,0.001530291,0.0001346127,0.07142052,0.004207857,0.6713357,0.2491833,0.000080269],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"review","genre_scores_codex":[0.008568293,0.2299423,0.6940475,0.002899477,0.001112165,0.0001651583,0.0006557111,0.002013976,0.06059551],"genre_scores_gemma":[0.2494986,0.3503652,0.3345906,0.002480665,0.004550074,0.000620628,0.001884384,0.001263072,0.0547469],"genre_candidate":"review","genre_consensus":null,"teacher_disagreement_score":0.008007152,"threshold_uncertainty_score":0.02678657,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03091224222555638,"score_gpt":0.2746827783910922,"score_spread":0.2437705361655358,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}