{"id":"W4409416357","doi":"10.2196/62909","title":"Summarizing Online Patient Conversations Using Generative Language Models: Experimental and Comparative Study","year":2025,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Machine Learning in Healthcare","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Computer science; Language model; Task (project management); Natural language processing; Generative grammar; Artificial intelligence; Information retrieval; Transformer; Data science","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009196114,0.001959294,0.000991907,0.001117718,0.0005240001,0.001397158,0.001691678,0.001677026,0.003429917],"category_scores_gemma":[0.0403339,0.0006039232,0.001035632,0.0006778738,0.0009642494,0.002467071,0.001702448,0.001793776,0.001247996],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00106483,"about_ca_system_score_gemma":0.0009011123,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002434778,"about_ca_topic_score_gemma":0.002509257,"domain_scores_codex":[0.9928119,0.005174696,0.0005071402,0.0008356442,0.0004804847,0.0001901368],"domain_scores_gemma":[0.8998648,0.09272331,0.001589963,0.002926985,0.002060327,0.0008345834],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.01235093,0.02444629,0.02667523,0.007424146,0.001388078,0.00168071,0.01363923,0.3059735,0.0396305,0.003299238,0.01168724,0.551805],"study_design_scores_gemma":[0.002308239,0.01882387,0.01545149,0.0002926996,0.0008735814,0.0008251541,0.003672173,0.9079061,0.03747143,0.005751921,0.006276391,0.0003470469],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9572691,0.001170818,0.03438191,0.0003658646,0.0001953512,0.0008644505,0.001036196,0.00204599,0.002670403],"genre_scores_gemma":[0.9316916,0.0005760716,0.06175645,0.0002754601,0.0001920811,0.0008976235,0.002986754,0.0002506022,0.001373436],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.009196114,"threshold_uncertainty_score":0.04863429,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0673433530193716,"score_gpt":0.3960594878841782,"score_spread":0.3287161348648066,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}