{"id":"W2947494553","doi":"10.1111/jebm.12343","title":"Evaluating people's ability to assess treatment claims: Validating a test in Mandarin from Claim Evaluation Tools database","year":2019,"lang":"en","type":"article","venue":"Journal of Evidence-Based Medicine","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":17,"is_retracted":false,"has_abstract":true,"ca_institutions":"McMaster University; Hamilton Health Sciences; Impact","funders":"Ministry of Science and Technology of the People's Republic of China","keywords":"Mandarin Chinese; Test (biology); Database; Computer science; Psychology; Linguistics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[{"model":"gemma","categories":[],"domain":null,"study_design":"observational","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"},{"model":"gpt","categories":[],"domain":null,"study_design":"observational","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"}],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02967673,0.0004829759,0.0007719094,0.003477973,0.0007392097,0.001691982,0.001359349,0.0008911599,0.003708544],"category_scores_gemma":[0.08816238,0.0003230577,0.00160539,0.002002086,0.0007452946,0.001471972,0.002168369,0.000801057,0.00107721],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001220559,"about_ca_system_score_gemma":0.002359151,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002401032,"about_ca_topic_score_gemma":0.003972413,"domain_scores_codex":[0.9769702,0.01037245,0.005338151,0.001002919,0.0055808,0.0007354501],"domain_scores_gemma":[0.9167365,0.04685601,0.01305338,0.00625748,0.01586096,0.001235653],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.001475964,0.002151599,0.7929701,0.0005232818,0.0003581233,0.0002341219,0.003330425,0.001718098,0.002090717,0.00108529,0.006099553,0.1879628],"study_design_scores_gemma":[0.0002702068,0.002000195,0.9704124,0.0003074496,0.0001499276,0.0004069198,0.001600635,0.009984422,0.004116324,0.0009749842,0.009670394,0.0001062365],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.975603,0.0002370553,0.009253485,0.0004996113,0.0000868783,0.002665418,0.003297337,0.0002931673,0.008064087],"genre_scores_gemma":[0.963907,0.0001535531,0.02722449,0.0002978352,0.00005425964,0.003374577,0.00375227,0.00004579765,0.001190238],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02967673,"threshold_uncertainty_score":0.1569474,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.9102972500589558,"score_gpt":0.6288915867040393,"score_spread":0.2814056633549165,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}