{"id":"W7131132546","doi":"10.1109/mlnlp66797.2025.11387796","title":"PersonaDrift: A Benchmark for Temporal Anomaly Detection in Language-Based Dementia Monitoring","year":2025,"lang":"","type":"article","venue":"","topic":"Persona Design and Applications","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Benchmark (surveying); Anomaly detection; Baseline (sea); Statistical model; Hidden Markov model; Context (archaeology); Supervised learning; Replicate","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002566911,0.001770157,0.0009318907,0.002263824,0.0005494451,0.001197167,0.001925468,0.001576761,0.0008686781],"category_scores_gemma":[0.01207052,0.0002392184,0.0007172142,0.001351026,0.0004867839,0.001175038,0.001445519,0.001037535,0.001029724],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009434323,"about_ca_system_score_gemma":0.0008723235,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01465739,"about_ca_topic_score_gemma":0.01491919,"domain_scores_codex":[0.9971713,0.0009985291,0.000324104,0.0007532609,0.0005517987,0.0002010142],"domain_scores_gemma":[0.9962546,0.001658485,0.0004225245,0.0005758588,0.0007504501,0.0003381174],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.005127796,0.003112762,0.1410148,0.002637613,0.001368329,0.002342934,0.001377213,0.2236737,0.02205552,0.003575017,0.08083636,0.5128779],"study_design_scores_gemma":[0.0003089553,0.001714146,0.05363796,0.0001798294,0.0001650941,0.00187941,0.0008876759,0.8943865,0.01736423,0.005077294,0.02423992,0.0001591338],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8428199,0.00540537,0.08397882,0.001264035,0.0006895692,0.0007796678,0.03232658,0.02616051,0.006575618],"genre_scores_gemma":[0.872106,0.0007712339,0.07822351,0.0004059016,0.0001418248,0.0005504406,0.04547506,0.0004391206,0.00188698],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01465739,"threshold_uncertainty_score":0.02914417,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0164323268701983,"score_gpt":0.2841574089856457,"score_spread":0.2677250821154474,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}