SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring Paper • 2608.09802 • Published 1 day ago • 61
The Optimizer Is the Agent: Reasoning-Driven Search across Prompts, Programs, and ML Workflows Paper • 2608.06714 • Published 4 days ago • 4
The Optimizer Is the Agent: Reasoning-Driven Search across Prompts, Programs, and ML Workflows Paper • 2608.06714 • Published 4 days ago • 4
Characterizing the Quality Profile of AI-Generated C++ in Production Paper • 2608.06640 • Published 5 days ago • 4
Modular TTT: Rethinking Test-Time Training as Composable Modules Paper • 2608.07110 • Published 4 days ago • 6
GST-Bench: Can VLMs Develop Global Spatial Awareness from Video? Paper • 2608.05747 • Published 5 days ago • 43
HarnessOpt-Bench: Evaluating LLMs at Harness Optimization Paper • 2608.06301 • Published 5 days ago • 33