{"id":"W4391983664","doi":"10.5114/pja.2024.135380","title":"Evaluating ChatGPT-3.5 in allergology: performance in the Polish Specialist Examination","year":2024,"lang":"en","type":"article","venue":"Alergologia Polska - Polish Journal of Allergology","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":10,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Library science; Computer science","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01027597,0.0005627305,0.0009681286,0.002362033,0.0007137181,0.002066219,0.0007533263,0.0009507952,0.006314619],"category_scores_gemma":[0.02844863,0.0002843942,0.001933141,0.001290765,0.0004324598,0.001313037,0.002592154,0.001408557,0.002766794],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001514936,"about_ca_system_score_gemma":0.002217896,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005590503,"about_ca_topic_score_gemma":0.008783741,"domain_scores_codex":[0.9914532,0.002634123,0.001599134,0.0004615374,0.003142505,0.0007095972],"domain_scores_gemma":[0.985031,0.004792462,0.002635832,0.0005124579,0.005242574,0.001785685],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.001654189,0.0003633985,0.6215926,0.002428974,0.0004859615,0.0009391905,0.001614885,0.0009002146,0.002384898,0.000683061,0.04423478,0.3227178],"study_design_scores_gemma":[0.000120137,0.0009742031,0.9452866,0.002264399,0.0005385599,0.00420478,0.001851997,0.002162714,0.002861827,0.001027852,0.03856702,0.0001399029],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7806549,0.06543646,0.01750307,0.01977197,0.003598683,0.003047738,0.007558815,0.001401281,0.1010271],"genre_scores_gemma":[0.9513641,0.01483548,0.0197544,0.002545749,0.0006375121,0.0009285217,0.003798275,0.0002213701,0.0059146],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01027597,"threshold_uncertainty_score":0.05434519,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2005421946447297,"score_gpt":0.4673238457585467,"score_spread":0.266781651113817,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}