Back to AI TrendsScaling & Deployment

OpenAI udfordrer standarden for kodning: Er AI-benchmarks blevet upålidelige?

OpenAI Blog July 8, 2026
OpenAI udfordrer standarden for kodning: Er AI-benchmarks blevet upålidelige?

En ny analyse fra OpenAI afslører kritiske svagheder i SWE-Bench Pro, som bruges til at måle AI-modellers evne til softwareudvikling. For tekniske ledere betyder det, at de nuværende ranglister over AI-værktøjer kan være misvisende, og at vi har brug for mere præcise metrikker for at vurdere den reelle forretningsværdi af AI-kodning.

Key Intelligence

  • OpenAI har fundet betydelige mængder 'støj' i SWE-Bench Pro, som forvrider evalueringen af LLM-modeller.
  • Mange testopgaver i benchmarken er enten uløselige eller har mangelfulde tests, hvilket straffer ellers kapable AI-modeller.
  • Analysen viser, at selv små fejl i evalueringen kan føre til store forskelle i, hvordan modeller som GPT-4o eller Claude rangeres.
  • Det er nu sværere for CTO'er at træffe valg baseret udelukkende på offentlige benchmarks, da tallene ikke altid afspejler virkelighedens kodningsevner.
  • OpenAI foreslår en mere stringent tilgang til evaluering for at sikre, at AI-udviklingen bevæger sig i den rigtige retning.
  • Vidste du, at op mod en betydelig del af test-cases i populære benchmarks kan indeholde fejl, der gør dem umulige for en AI at løse korrekt?