openai.com3 weeks agoSeparating signal from noise in coding evaluationsA new analysis from OpenAI reveals issues in SWE-Bench Pro, a popular coding benchmark, raising concerns about reliability and accuracy in evaluating AI models.Visit openai.comBookmarkAdd to collection