{"id":"W4410887599","doi":"10.1109/isqed65160.2025.11014310","title":"Evaluating LLM-Based Communicative Agents for Verilog Design","year":2025,"lang":"en","type":"article","venue":"","topic":"Speech and dialogue systems","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Calgary","funders":"Natural Sciences and Engineering Research Council of Canada; Intel Corporation","keywords":"Computer science; Verilog; Computer architecture; Embedded system; Field-programmable gate array","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0008737124,0.00007804294,0.0001194159,0.00007121031,0.0001531682,0.00008728756,0.0009229795,0.00003742295,0.00001086957],"category_scores_gemma":[0.00026296,0.00006698931,0.00005350143,0.0002571293,0.00002295685,0.0001060987,0.0001398273,0.00004272271,0.00003539483],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00004572568,"about_ca_system_score_gemma":0.0002059513,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00005324987,"about_ca_topic_score_gemma":0.000007302156,"domain_scores_codex":[0.9991214,0.0002017025,0.0001669935,0.0002050446,0.0001248039,0.0001800565],"domain_scores_gemma":[0.998325,0.0007920912,0.00005336326,0.0006765624,0.0001149638,0.0000379582],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002824333,0.0006727489,0.001150671,0.0001910254,0.000205467,0.000005021883,0.001675471,0.008262249,0.01005025,0.5752704,0.1532081,0.2490263],"study_design_scores_gemma":[0.001454426,0.0003295122,0.0006146682,0.00005530081,0.000008964026,3.996427e-7,0.00005009692,0.9468641,0.025962,0.0193297,0.005180751,0.0001501348],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.0004622527,0.00008779368,0.9823751,0.0007252012,0.0003425907,0.0005755064,0.0000014834,0.0001358254,0.01529429],"genre_scores_gemma":[0.3790974,8.8037e-7,0.6179782,0.001513033,0.00001696885,0.000150987,0.000004591669,0.000003650771,0.001234369],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.9386018,"threshold_uncertainty_score":0.2731745,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2232403993404547,"score_gpt":0.427165115659945,"score_spread":0.2039247163194902,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}