{"id":"W7116384933","doi":"10.1038/s41597-025-06021-5","title":"Responsible AI measures dataset for ethics evaluation of AI systems","year":2025,"lang":"en","type":"article","venue":"Scientific Data","topic":"Ethics and Social Impacts of AI","field":"Social Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"Google (Canada); McGill University","funders":"","keywords":"Normative; Usability; Set (abstract data type); Interpretation (philosophy); Domain (mathematical analysis); Visualization; Corporate governance","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["research_integrity"],"consensus_categories":[],"category_scores_codex":[0.007680823,0.0008173162,0.0006569101,0.01344009,0.00168283,0.003111192,0.001559767,0.001741522,0.03653676],"category_scores_gemma":[0.07052176,0.0003513855,0.0008475198,0.01475724,0.0009434574,0.002284657,0.002568881,0.001979803,0.01567178],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003248716,"about_ca_system_score_gemma":0.004370062,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009714425,"about_ca_topic_score_gemma":0.02076721,"domain_scores_codex":[0.9876179,0.003034789,0.002818554,0.0009198689,0.005062924,0.0005460329],"domain_scores_gemma":[0.8916572,0.05559728,0.01189363,0.01180718,0.02657065,0.002474017],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.0002304744,0.0002539557,0.01495273,0.003341391,0.00009296506,0.0001249072,0.001022753,0.0009619911,0.000701233,0.01164973,0.9247168,0.04195118],"study_design_scores_gemma":[0.0001522429,0.00009305802,0.04434413,0.0009798604,0.00003601034,0.000128972,0.00125979,0.0006796632,0.0009043153,0.00442792,0.9469203,0.00007379941],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.007641515,0.0004233834,0.001817193,0.0008291737,0.0001324601,0.0007607373,0.9656383,0.0005981006,0.02215923],"genre_scores_gemma":[0.0194277,0.0003069815,0.007372459,0.0004074402,0.00009863262,0.00403661,0.9619743,0.000369466,0.006006493],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.9982585,"threshold_uncertainty_score":0.1222276,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.5162686606936119,"score_gpt":0.5809189398766879,"score_spread":0.06465027918307598,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}