SlopCodeBench: Benchmarking How Coding Agents Degrade over Long-Horizon Task (arxiv.org) 1 points by mohsen1 5mo ago ↗ HN
0 comments
[ 9.2 ms ] story [ 20.8 ms ] threadNo comments yet.