Visual TL;DR. Existing Benchmarks Flawed leads to DeepSWE Introduced. DeepSWE Introduced features Contamination Resistant. Contamination Resistant achieved by Realistic Tasks. Contamination Resistant enables Better AI Evaluation. Realistic Tasks contributes to Better AI Evaluation. DeepSWE Introduced also Supports Multiple Languages. DeepSWE Introduced unveiled at Presented at Fair.
- Existing Benchmarks Flawed: suffer from data contamination, brittle verification, and model clustering
- DeepSWE Introduced: new coding benchmark by Data Curve for AI coding agents
- Contamination Resistant: 113 original, long-horizon tasks, specifically authored, not scraped
- Realistic Tasks: draws from nearly 100 repositories, median one task per repository
- Better AI Evaluation: more accurately measures capabilities of AI coding agents on realistic tasks
- Supports Multiple Languages: includes TypeScript, expanding utility beyond single-language focus
- Presented at Fair: James Shi, Data Curve founding engineer, presented at AI Engineer World's Fair
Visual TL;DR
