{"meta":{"query_hash":"c45847c6b3a0","filters":{"venue":"Evaluation and Assessment in Software Engineering"},"cohort_total":3,"direct_labels_cover":0,"predictions_cover":3,"exported":3,"export_cap":100000,"truncated":false,"label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12"},"permalink":"https://metacan.xera.ac/q/c45847c6b3a0","api":"https://metacan.xera.ac/api/v1/cohort?venue=Evaluation+and+Assessment+in+Software+Engineering"},"results":[{"id":"W3158412293","doi":"10.1145/3463274.3463342","title":"DABT: A Dependency-aware Bug Triaging Method","year":2021,"lang":"en","type":"article","venue":"Evaluation and Assessment in Software Engineering","topic":"Software Engineering Research","field":"Computer Science","cited_by":17,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Toronto Metropolitan University","funders":"","keywords":"Software regression; Dependency (UML); Software bug; Security bug; Software; Blocking (statistics); Process (computing)","score_opus":0.03924068237700611,"score_gpt":0.3814679397277233,"score_spread":0.3422272573507172,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3158412293","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.025276832,0.0007478069,0.97241265,0.00034118988,0.00048488422,0.00026032998,0.0000019252582,0.00041245908,0.000061937084],"genre_scores_gemma":[0.49540022,0.000046203186,0.5042297,0.000048859845,0.0000564717,0.00012177735,0.0000146971925,0.000022456825,0.000059594484],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9976222,0.00019538164,0.00033234377,0.000566638,0.0008942079,0.00038923373],"domain_scores_gemma":[0.99756414,0.0015359775,0.00004577532,0.00048066728,0.00024251547,0.00013093451],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0025243352,0.00019953026,0.00024078813,0.0003174719,0.00007075259,0.00026441482,0.00033446148,0.00008310925,0.000076694625],"category_scores_gemma":[0.0019415311,0.00022359724,0.000052179214,0.00090590067,0.000007404898,0.00055091124,0.0003097862,0.00047681903,0.000005455108],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0000053913573,0.00021710586,0.20630682,0.0003720887,0.00012061991,0.0003270972,0.0016425177,0.341572,0.0022443775,0.009547036,0.00022441758,0.43742055],"study_design_scores_gemma":[0.00092920935,0.00002031923,0.13335739,0.00012852748,0.000010921552,0.000051858693,0.000055650373,0.8629988,0.00093979447,0.0005033513,0.00071560254,0.000288568],"about_ca_topic_score_codex":0.000012549537,"about_ca_topic_score_gemma":0.00000520185,"teacher_disagreement_score":0.52142686,"about_ca_system_score_codex":0.0002810338,"about_ca_system_score_gemma":0.00047028103,"threshold_uncertainty_score":0.91180307},"labels":[],"label_agreement":null},{"id":"W3173944821","doi":"10.1145/3463274.3463343","title":"Assessing Developer Expertise from the Statistical Distribution of Programming Syntax Patterns","year":2021,"lang":"en","type":"article","venue":"Evaluation and Assessment in Software Engineering","topic":"Software Engineering Research","field":"Computer Science","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Polytechnique Montréal","funders":"","keywords":"Computer science; Task (project management); Syntax; Context (archaeology); Software engineering; Programming language; Data science; Artificial intelligence; Systems engineering; Engineering","score_opus":0.04264145128656933,"score_gpt":0.357883313491921,"score_spread":0.31524186220535166,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3173944821","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.35491833,0.00024739216,0.64435977,0.00013396183,0.00013207867,0.00012799799,0.000009870624,0.000069063055,0.0000015674557],"genre_scores_gemma":[0.80209535,0.000020972608,0.19764619,0.000014301427,0.000028220009,0.00007353647,0.00011011914,0.000009518681,0.0000018110302],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.99836046,0.00014133351,0.00029745488,0.00031190642,0.0006581028,0.00023073827],"domain_scores_gemma":[0.99750483,0.0018930129,0.00004680602,0.00029132786,0.00020446665,0.00005958256],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00091163185,0.00012555374,0.00015547038,0.000047887843,0.000059688457,0.0002876234,0.00021899039,0.00005009436,0.000029872777],"category_scores_gemma":[0.002833831,0.00010987445,0.000023896466,0.00037892046,0.000016881686,0.000460675,0.00019771938,0.00026223177,9.804618e-7],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0000014745542,0.00008931311,0.529316,0.00008037576,0.00004002789,0.000032347503,0.00090941053,0.01206395,0.000830021,0.002293467,0.00003943738,0.45430416],"study_design_scores_gemma":[0.00025285652,0.000008931171,0.7695247,0.00017163323,0.000007360173,0.0000048209135,0.00011886468,0.22874841,0.0007885715,0.00005780894,0.00020033539,0.000115688],"about_ca_topic_score_codex":0.000054966305,"about_ca_topic_score_gemma":0.000009153246,"teacher_disagreement_score":0.4541885,"about_ca_system_score_codex":0.00021525206,"about_ca_system_score_gemma":0.0002996794,"threshold_uncertainty_score":0.448055},"labels":[],"label_agreement":null},{"id":"W3176225318","doi":"10.1145/3463274.3463359","title":"Towards a More Structured Peer Review Process with Empirical Standards","year":2021,"lang":"en","type":"article","venue":"Evaluation and Assessment in Software Engineering","topic":"scientometrics and bibliometrics research","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Queen's University; Dalhousie University","funders":"","keywords":"Process (computing); Computer science; Process management; Empirical research; Peer review; Business; Programming language; Political science","score_opus":0.4179059071787115,"score_gpt":0.6254396821821306,"score_spread":0.20753377500341913,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3176225318","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.7250865,0.02374579,0.2299976,0.017158555,0.0006369853,0.0014092696,0.00014746962,0.00012919225,0.0016886102],"genre_scores_gemma":[0.96113265,0.0011607304,0.036575682,0.0004982896,0.000057356665,0.000109631015,0.000059886395,0.000021189675,0.00038458372],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.9817023,0.0001635877,0.00047228596,0.0005478231,0.016813628,0.00030031742],"domain_scores_gemma":[0.98830533,0.000780272,0.00009743478,0.00034333218,0.010274815,0.00019882186],"candidate_categories":["metaresearch","bibliometrics"],"consensus_categories":[],"category_scores_codex":[0.023210805,0.00014735213,0.0003170516,0.004494478,0.000074039395,0.0007816319,0.00034831246,0.000063570405,0.00086478284],"category_scores_gemma":[0.059112463,0.000100995276,0.000045096025,0.038386036,0.000030460405,0.00039031138,0.00015350981,0.000354619,0.0000023395366],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000015958563,0.00014152574,0.43049052,0.00046962968,0.000043500884,0.00008055152,0.0006330712,0.01254423,0.00006737345,0.0002317378,0.009643277,0.5456386],"study_design_scores_gemma":[0.0012350524,0.00009650244,0.85535634,0.0005226606,0.000030746287,0.000037875896,0.0005582723,0.103378706,0.00019655137,0.0008840855,0.0373697,0.0003335371],"about_ca_topic_score_codex":0.0000038129742,"about_ca_topic_score_gemma":0.000008198741,"teacher_disagreement_score":0.5453051,"about_ca_system_score_codex":0.00027470273,"about_ca_system_score_gemma":0.0017162742,"threshold_uncertainty_score":0.9820535},"labels":[],"label_agreement":null}]}