{"id":"W4416910393","doi":"10.1177/19160216251387617","title":"Thyroid Nodule Experts Evaluating ChatGPT’s Assessment of Thyroid Nodules Classified by the Bethesda System for Reporting Thyroid Cytopathology","year":2025,"lang":"en","type":"article","venue":"Journal of Otolaryngology - Head and Neck Surgery","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Jewish General Hospital; Université de Montréal; Hôpital du Sacré-Cœur de Montréal; McGill University Health Centre","funders":"","keywords":"Thyroid nodules; Bethesda system; Thyroid; Thyroid cancer; Nodule (geology); Cytopathology; Malignancy; Likert scale","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01671244,0.0003269637,0.0003799874,0.001526129,0.0009078818,0.0008326489,0.0008987024,0.000833619,0.005353575],"category_scores_gemma":[0.05742895,0.0002809161,0.0007361549,0.0008298506,0.0008758265,0.0007183528,0.003051091,0.0008978162,0.000887221],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001879039,"about_ca_system_score_gemma":0.002653772,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005717584,"about_ca_topic_score_gemma":0.01083823,"domain_scores_codex":[0.9833613,0.00977466,0.00217671,0.0009076555,0.002855241,0.000924326],"domain_scores_gemma":[0.9541143,0.02109219,0.008449379,0.00179317,0.01225876,0.002292314],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0006064404,0.0002145448,0.8763728,0.001145953,0.0001257031,0.001386226,0.03017229,0.0005970899,0.007684281,0.0002890057,0.01429757,0.06710807],"study_design_scores_gemma":[0.0001257703,0.001069245,0.9315028,0.000947941,0.0001536002,0.004399138,0.03091481,0.003953764,0.004573928,0.0007929847,0.02139631,0.0001696794],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9799039,0.0006727048,0.00424801,0.002290231,0.0002017878,0.001403787,0.0009293628,0.0001829326,0.01016717],"genre_scores_gemma":[0.9891412,0.0004172525,0.006902039,0.0007503973,0.00007830363,0.0007693325,0.0005085981,0.00003160628,0.001401288],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01671244,"threshold_uncertainty_score":0.08838493,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1272558511958591,"score_gpt":0.4306875306841474,"score_spread":0.3034316794882884,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}