Second Thought: Reasoning in Parallel as LLM Agents Act and Observe Paper • 2608.13667 • Published 10 days ago • 16
Are Performance-Optimization Benchmarks Reliably Measuring Coding Agents? Paper • 2607.01211 • Published Jul 1 • 14
SecureAgentBench: Benchmarking Secure Code Generation under Realistic Vulnerability Scenarios Paper • 2509.22097 • Published Sep 26, 2025 • 3
How Do Practitioners Build SE Agents? Insights from a Mixed-Methods Study Paper • 2607.10856 • Published Jul 12 • 7