{"id":"W7125792265","doi":"10.21428/594757db.d23b1499","title":"Enhancing Legal Text Entailment: Evaluating Model Architectures, Training Approaches, and Interpretability","year":2025,"lang":"en","type":"article","venue":"","topic":"Artificial Intelligence in Law","field":"Social Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Ottawa","funders":"","keywords":"Interpretability; Textual entailment; Context (archaeology); Logical consequence; Task (project management); Language model; Adaptation (eye); Focus (optics)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007801773,0.001900778,0.0007981867,0.001566162,0.0006713351,0.002094212,0.002003915,0.001819359,0.002407094],"category_scores_gemma":[0.0326883,0.0005938533,0.0009845087,0.0008715189,0.0007996191,0.003746949,0.001713447,0.004068949,0.001031396],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002711384,"about_ca_system_score_gemma":0.002578198,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01655356,"about_ca_topic_score_gemma":0.02468843,"domain_scores_codex":[0.9974325,0.001400483,0.0001786735,0.0006058622,0.0002257248,0.0001567536],"domain_scores_gemma":[0.977125,0.01869224,0.0006490815,0.00169486,0.001436189,0.0004025268],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.001984529,0.001596401,0.03640213,0.0007500795,0.0005901618,0.0002450022,0.0009706323,0.4561124,0.01071458,0.002856108,0.006568035,0.4812099],"study_design_scores_gemma":[0.00008767426,0.0003432737,0.002648705,0.00007670194,0.000160394,0.00005173077,0.0002227249,0.9862928,0.006510627,0.002178713,0.001398874,0.00002775431],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8541512,0.002692315,0.1230627,0.002438907,0.0002276331,0.0006921864,0.001216706,0.00786133,0.007656871],"genre_scores_gemma":[0.8983035,0.0005516868,0.09507129,0.0003831999,0.00004967464,0.0003304645,0.002959509,0.0002260603,0.002124541],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01655356,"threshold_uncertainty_score":0.04126018,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1519790996233589,"score_gpt":0.4051567908166698,"score_spread":0.2531776911933109,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}