{"id":"W7117277561","doi":"","title":"Reason2Decide: Rationale-Driven Multi-Task Learning","year":2025,"lang":"","type":"article","venue":"ArXiv.org","topic":"Machine Learning in Healthcare","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Task (project management); Fidelity; Triage; Key (lock); Language model; Face (sociological concept); Probabilistic logic","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","sts","research_integrity","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.001204289,0.0006276059,0.0006725686,0.0004748372,0.001506708,0.0004117437,0.002174142,0.0004359869,0.0004223208],"category_scores_gemma":[0.003418828,0.0007015848,0.0003080459,0.00197444,0.0002486487,0.0007789287,0.001411901,0.00249867,0.002779339],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003834986,"about_ca_system_score_gemma":0.001220759,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000596967,"about_ca_topic_score_gemma":0.0001745963,"domain_scores_codex":[0.9936793,0.001426496,0.001172849,0.001795357,0.0007603088,0.001165663],"domain_scores_gemma":[0.9955618,0.0011356,0.0005711865,0.001642137,0.0006975099,0.0003917044],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.000024039,0.0001509338,0.9411707,0.0002270453,0.00009006746,0.00006526846,0.001809053,0.01330884,0.0003953713,0.007040191,0.001442606,0.03427592],"study_design_scores_gemma":[0.0008321767,0.0001161273,0.5781514,0.0004520429,0.00003538273,0.00001508659,0.0001006207,0.3604611,0.0001357482,0.00009059446,0.05916759,0.0004421175],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6302987,0.004071158,0.3216588,0.02750356,0.005715415,0.00148059,0.00001113137,0.0009330152,0.008327564],"genre_scores_gemma":[0.951028,0.0003026502,0.01558661,0.002592862,0.0004394488,0.0000838746,0.00002997652,0.00005305672,0.02988345],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.3630193,"threshold_uncertainty_score":0.9998026,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05251389749827868,"score_gpt":0.3347061983820623,"score_spread":0.2821923008837836,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}