{"id":"W4400977996","doi":"10.1016/j.patter.2024.101030","title":"Exploring the reversal curse and other deductive logical reasoning in BERT and GPT-based large language models","year":2024,"lang":"en","type":"article","venue":"Patterns","topic":"Topic Modeling","field":"Computer Science","cited_by":10,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"National Institutes of Health; CHEO Research Institute","keywords":"Transformer; Computer science; Encoder; Curse; Generative grammar; Logical reasoning; Comprehension; Artificial intelligence; Natural language processing; Autoencoder; Intersection (aeronautics); Context (archaeology); Machine learning; Programming language; Deep learning","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004582939,0.0007280914,0.0005016857,0.0006744877,0.0004389843,0.002550506,0.001431399,0.001037814,0.002632841],"category_scores_gemma":[0.02884127,0.0006758154,0.0008151943,0.0006477472,0.001449816,0.006960858,0.001871789,0.00333025,0.0004641646],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001360076,"about_ca_system_score_gemma":0.001485442,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005180012,"about_ca_topic_score_gemma":0.01040807,"domain_scores_codex":[0.998544,0.0008052455,0.00007702267,0.0003015272,0.0002000915,0.00007221285],"domain_scores_gemma":[0.9838193,0.01342876,0.0005781956,0.001383835,0.0005398439,0.0002500977],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003862462,0.0002836039,0.01291297,0.0004562835,0.0002034364,0.0008131923,0.004552391,0.371531,0.01389827,0.3117998,0.003426269,0.2797365],"study_design_scores_gemma":[0.00001679497,0.00004225752,0.0004515981,0.00002037511,0.0000211217,0.0001018913,0.0001712581,0.8600039,0.003058815,0.1349183,0.001173594,0.00002006919],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1573396,0.0002049114,0.834919,0.001192273,0.00003255991,0.00008186638,0.0002315804,0.001200126,0.004798195],"genre_scores_gemma":[0.8239076,0.0001514337,0.1733524,0.000229606,0.00001849009,0.00008693537,0.0004432674,0.0001706212,0.001639642],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.005180012,"threshold_uncertainty_score":0.02423722,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.07904218656723885,"score_gpt":0.2861965466404941,"score_spread":0.2071543600732552,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}