{"id":"W7126435103","doi":"10.21428/594757db.86843c77","title":"Evaluating the Effectiveness of Cost-Efficient Large Language Models in Benchmark Biomedical Tasks","year":2025,"lang":"en","type":"article","venue":"","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":1,"is_retracted":false,"has_abstract":false,"ca_institutions":"York University","funders":"","keywords":"Benchmark (surveying); Language model; Task (project management); Feature (linguistics); Natural language","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004949787,0.002734684,0.001410483,0.001376706,0.0006495026,0.001892556,0.00254681,0.00294402,0.002758499],"category_scores_gemma":[0.02371702,0.000717909,0.001145888,0.001873252,0.0008085211,0.003580969,0.001153917,0.002133293,0.001228533],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00204423,"about_ca_system_score_gemma":0.002942504,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02503339,"about_ca_topic_score_gemma":0.02814478,"domain_scores_codex":[0.9975079,0.001228484,0.0002438055,0.0004654558,0.0003509968,0.0002032743],"domain_scores_gemma":[0.9766319,0.02050689,0.0004562898,0.0009119257,0.00114816,0.0003448812],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"not_applicable","study_design_scores_codex":[0.006138588,0.001999317,0.004893722,0.001452117,0.0007785506,0.0002975215,0.0001510153,0.7381557,0.006289989,0.001503306,0.01521871,0.2231214],"study_design_scores_gemma":[0.0005416205,0.0008399602,0.001400583,0.00005068957,0.0002777757,0.00008731875,0.0001518356,0.988628,0.004260637,0.002363028,0.001354892,0.00004375444],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8843591,0.01896377,0.06474931,0.00467175,0.001228095,0.0004593801,0.006182087,0.01058571,0.008800779],"genre_scores_gemma":[0.9244464,0.002848826,0.05834132,0.00078819,0.0002394773,0.0002416091,0.009430273,0.0005215245,0.00314235],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02503339,"threshold_uncertainty_score":0.04977536,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1506361761146206,"score_gpt":0.5112991416099333,"score_spread":0.3606629654953126,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}