{"id":"W7006323907","doi":"","title":"Towards Effectively Testing Sequence-to-Sequence models from White-Box Perspectives","year":2024,"lang":"en","type":"dissertation","venue":"UWSpace (University of Waterloo)","topic":"Cell Image Analysis Techniques","field":"Biochemistry, Genetics and Molecular Biology","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Blackberry (Canada)","funders":"","keywords":"Machine translation; Sentence; Security token; Word (group theory); Benchmark (surveying); Question answering; Field (mathematics); Translation (biology)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01729127,0.002647583,0.001806664,0.002317105,0.0006560451,0.003219133,0.004126783,0.00419566,0.00266893],"category_scores_gemma":[0.07789973,0.001126389,0.001737743,0.001638832,0.002990522,0.008462166,0.003868705,0.004654215,0.001685639],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001825509,"about_ca_system_score_gemma":0.003181435,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006367766,"about_ca_topic_score_gemma":0.006489539,"domain_scores_codex":[0.9836338,0.009583389,0.0007943704,0.003365641,0.00214666,0.0004761312],"domain_scores_gemma":[0.8951631,0.08434943,0.003602264,0.01035914,0.005539552,0.0009866284],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001857395,0.001148666,0.01839794,0.001119268,0.0006268084,0.0007489434,0.0009543314,0.6750008,0.03085491,0.021969,0.01016305,0.2371589],"study_design_scores_gemma":[0.00004004787,0.000192963,0.0004364486,0.00002132394,0.000019119,0.00006179354,0.00006830633,0.9801608,0.005926195,0.01218943,0.0008648249,0.00001877339],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1117664,0.001091537,0.8724427,0.000922491,0.0001665954,0.0003041732,0.001195885,0.01050263,0.001607545],"genre_scores_gemma":[0.5474448,0.0004356843,0.4407065,0.0012536,0.0001527766,0.0005262084,0.006613291,0.001316551,0.001550714],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01729127,"threshold_uncertainty_score":0.09144604,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01762924187040569,"score_gpt":0.2493186047430688,"score_spread":0.2316893628726631,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}