{"id":"W4417398205","doi":"10.21083/caree.v1i1.8922","title":"Evaluating the Effectiveness of Large Language Models for Livestock and Climate-Related Agricultural Advice in Ontario","year":2025,"lang":"","type":"article","venue":"Canadian Agri-food & Rural Advisory Extension and Education Journal","topic":"Computational and Text Analysis Methods","field":"Social Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Guelph","funders":"","keywords":"Comparability; Context (archaeology); Quality (philosophy); Agriculture; Livestock; Reliability (semiconductor)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007398205,0.0009387415,0.0006237595,0.001289104,0.00102664,0.001706255,0.001731317,0.001399073,0.003305825],"category_scores_gemma":[0.04202483,0.0003917832,0.0008794315,0.001313315,0.0008525845,0.00172356,0.001609706,0.0009067851,0.0008351718],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.01514408,"about_ca_system_score_gemma":0.01082206,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_topic_score_codex":0.5086198,"about_ca_topic_score_gemma":0.5944052,"domain_scores_codex":[0.9954613,0.002545263,0.0003596693,0.0006985526,0.00075964,0.0001755988],"domain_scores_gemma":[0.9558826,0.03625334,0.00123236,0.001310213,0.004672002,0.0006494696],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.005604561,0.003755699,0.138435,0.005885385,0.0005324396,0.00158968,0.04629326,0.3052491,0.02083999,0.006517023,0.0224543,0.4428435],"study_design_scores_gemma":[0.000666942,0.002008797,0.0516954,0.0004693514,0.000402319,0.0002118373,0.01095639,0.8782404,0.01148908,0.003186524,0.04038513,0.0002878645],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9699382,0.000456591,0.01506086,0.001137806,0.00004479969,0.0009200638,0.002862918,0.002067519,0.00751125],"genre_scores_gemma":[0.9485757,0.0003802706,0.03835571,0.0002117765,0.00001785861,0.0006409569,0.006884082,0.0001392348,0.004794467],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.4913802,"threshold_uncertainty_score":0.988548,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03074393541240867,"score_gpt":0.3522021382032282,"score_spread":0.3214582027908195,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}