Skip to content
ben ebsworth
projects
blog
lab
hiking
about
Search
⌘K
Home
/
Lab
ben ebsworth
projects
blog
lab
hiking
about
Search
⌘K
Home
/
Lab
/
Harness Eval
/
Deep-swe Suite
benchmark suite
Deep-swe Suite
1 tasks evaluated across all models.
Tasks
Task
Complexity
Pass rate
Avg duration
Models
Add input key aliases to name mapping
medium
100%
56.0s
1