{"id":"W4413899309","doi":"10.20944/preprints202509.0042.v1","title":"Joint Evaluation (Jo.E): A Collaborative Framework for Rigorous Safety and Alignment Evaluation of AI Systems Integrating Human Expertise, LLMs, and AI Agents","year":2025,"lang":"en","type":"preprint","venue":"Preprints.org","topic":"Occupational Health and Safety Research","field":"Health Professions","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Vector Institute","funders":"","keywords":"Joint (building); Knowledge management; Computer science; Engineering ethics; Engineering; Risk analysis (engineering); Business; Architectural engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1649297,0.004006018,0.00276105,0.009379276,0.003200716,0.009465792,0.005605524,0.00462706,0.005454159],"category_scores_gemma":[0.2462326,0.001926598,0.003405307,0.002738715,0.009221922,0.0120639,0.0198229,0.006156851,0.001603336],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.004994482,"about_ca_system_score_gemma":0.02021872,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005705961,"about_ca_topic_score_gemma":0.006728102,"domain_scores_codex":[0.8076716,0.1397032,0.01047496,0.009838144,0.02898611,0.003326023],"domain_scores_gemma":[0.7245699,0.1617243,0.0219933,0.04938776,0.03527966,0.007045284],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0007057856,0.001165719,0.01111195,0.002500789,0.0009405178,0.0006698361,0.00716705,0.07733812,0.01135609,0.4133428,0.01645742,0.4572439],"study_design_scores_gemma":[0.000338503,0.001241826,0.003182568,0.001760048,0.0003781449,0.0005726112,0.001531002,0.4431453,0.01580514,0.4877842,0.04384284,0.0004178603],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.002637506,0.0002095074,0.9899611,0.0007837635,0.00005147746,0.001005909,0.0001019216,0.00202662,0.003222118],"genre_scores_gemma":[0.06797227,0.0001099607,0.928786,0.0003251779,0.00006422123,0.001329694,0.0002406694,0.0004486704,0.000723234],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.1649297,"threshold_uncertainty_score":0.8722422,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.388234883574905,"score_gpt":0.5827687880289053,"score_spread":0.1945339044540003,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}