{"id":"W4406289491","doi":"10.2196/64565","title":"Testing and Iterative Improvement of the CEN ISO/TS 82304-2 Health App Quality Assessment: Pilot Interrater Reliability Study","year":2025,"lang":"en","type":"article","venue":"JMIR Formative Research","topic":"Mobile Health and mHealth Applications","field":"Health Professions","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"Stedfast (Canada)","funders":"","keywords":"Preprint; Quality assessment; Quality (philosophy); Reliability engineering; Computer science; Engineering; World Wide Web; Evaluation methods; Physics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.223606,0.001173847,0.001456375,0.003012541,0.002442936,0.002500994,0.002118527,0.001192297,0.001493521],"category_scores_gemma":[0.2494696,0.001075109,0.002458346,0.001655887,0.002864219,0.002786659,0.005912697,0.002240364,0.0009355186],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003161477,"about_ca_system_score_gemma":0.01319614,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003242681,"about_ca_topic_score_gemma":0.007711069,"domain_scores_codex":[0.8544205,0.09738465,0.0160571,0.008270467,0.0206539,0.003213287],"domain_scores_gemma":[0.6260465,0.1679984,0.01505039,0.02784679,0.1592602,0.003797962],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.003976819,0.009433485,0.2997865,0.004299677,0.0007635411,0.001093449,0.2249147,0.00617035,0.02473824,0.005853198,0.01258628,0.4063838],"study_design_scores_gemma":[0.003424567,0.03356601,0.6029536,0.005755206,0.001655539,0.002152248,0.124107,0.0659361,0.0604553,0.01073864,0.08815853,0.001097283],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8542627,0.0006288106,0.1102274,0.0009067014,0.0004207358,0.02515277,0.0004633475,0.0007197217,0.007217711],"genre_scores_gemma":[0.7829545,0.000376255,0.1789467,0.0004851504,0.00009256407,0.03484657,0.0006427677,0.0001742904,0.00148117],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.7763939,"threshold_uncertainty_score":0.957432,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2250518391648572,"score_gpt":0.6056477568085593,"score_spread":0.3805959176437021,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}