{"id":"W4404079977","doi":"10.1017/s0266462324000382","title":"Is health technology assessment ready for generative pretrained transformer large language models? Report of a fishbowl inquiry","year":2024,"lang":"en","type":"review","venue":"International Journal of Technology Assessment in Health Care","topic":"Health Systems, Economic Evaluations, Quality of Life","field":"Economics, Econometrics and Finance","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Health Technology Assessment international","keywords":"Stakeholder; Health care; Generative grammar; Health technology; Terminology; Stakeholder engagement; Psychology; Political science; Medical education; Medicine; Public relations; Computer science; Linguistics","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2084159,0.000733648,0.0008004904,0.001844159,0.008609893,0.01061781,0.003772495,0.005286078,0.005160269],"category_scores_gemma":[0.2423379,0.001426365,0.001226957,0.001806095,0.02295595,0.01712032,0.02148496,0.01068742,0.0007049126],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.01615649,"about_ca_system_score_gemma":0.02614156,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00543713,"about_ca_topic_score_gemma":0.005166373,"domain_scores_codex":[0.8415007,0.1414735,0.002918985,0.003615754,0.007180141,0.00331095],"domain_scores_gemma":[0.6833789,0.2798859,0.00547489,0.009682012,0.01581158,0.005766864],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"qualitative","study_design_scores_codex":[0.00009364432,0.0002092775,0.002708791,0.0008723472,0.00002293365,0.0008135505,0.8992146,0.0003040627,0.00136732,0.05262647,0.006332534,0.03543453],"study_design_scores_gemma":[0.00004594803,0.0003189684,0.001534381,0.00161833,0.00002618339,0.0005560176,0.8616506,0.001740732,0.00158597,0.03631811,0.09453241,0.00007236502],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","genre_codex":"empirical","genre_gemma":"review","genre_scores_codex":[0.4941943,0.00376098,0.1255414,0.3235151,0.001142664,0.006681475,0.0004779965,0.0003955037,0.04429063],"genre_scores_gemma":[0.9026744,0.001624162,0.06618187,0.01941516,0.0001648024,0.004398922,0.0001742484,0.0002800276,0.005086371],"genre_candidate":"review","genre_consensus":null,"teacher_disagreement_score":0.7915841,"threshold_uncertainty_score":0.9761641,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3960788945934272,"score_gpt":0.5850093528456395,"score_spread":0.1889304582522123,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}