{"id":"W4410922640","doi":"10.1177/23312165251347131","title":"Language-agnostic, Automated Assessment of Listeners’ Speech Recall Using Large Language Models","year":2025,"lang":"en","type":"article","venue":"Trends in Hearing","topic":"Interpreting and Communication in Healthcare","field":"Health Professions","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"Baycrest Hospital; University of Toronto","funders":"University of Toronto; Natural Sciences and Engineering Research Council of Canada; Canada Research Chairs","keywords":"Recall; Computer science; Comprehension; Natural language processing; Context (archaeology); Spoken language; Similarity (geometry); Conversation; Speech perception; Linguistics; Psychology; Speech recognition; Artificial intelligence; Cognitive psychology; Perception; Communication","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0011502,0.0001381198,0.0003425283,0.0004991289,0.0002919978,0.000008324824,0.0003063076,0.0002140832,0.0002167816],"category_scores_gemma":[0.0002031418,0.0001393997,0.00006482912,0.0006581384,0.00002935222,0.00007854848,0.0003395799,0.0008316447,0.000005524605],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004034404,"about_ca_system_score_gemma":0.0002417602,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00839582,"about_ca_topic_score_gemma":0.001521421,"domain_scores_codex":[0.9975657,0.0007663838,0.0007722484,0.0002419625,0.0001824911,0.0004711463],"domain_scores_gemma":[0.9981992,0.000723963,0.0001986956,0.0007023647,0.0001206424,0.0000551169],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002162005,0.0009293276,0.6960256,0.004366313,0.0001993967,0.0001125935,0.1481451,0.02203074,0.01181439,0.06046769,0.003253715,0.05243892],"study_design_scores_gemma":[0.0009584536,0.00003680926,0.06650359,0.003866561,0.00002749375,0.000002093416,0.01816025,0.9095914,0.0002382829,0.000245202,0.0001739035,0.0001959685],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8967392,0.0004432754,0.0007461637,0.0004851041,0.00044684,0.0002213974,0.00002908443,0.0003505478,0.1005384],"genre_scores_gemma":[0.9869806,0.00002491345,0.01016585,0.0003556967,0.00004118588,0.00004895488,0.00004192352,0.00002188189,0.002318968],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.8875607,"threshold_uncertainty_score":0.9982073,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1178072682074484,"score_gpt":0.5206685656166137,"score_spread":0.4028612974091653,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}