OpenAI udfordrer standarden for kodning: Er AI-benchmarks blevet upålidelige?
OpenAI Blog July 8, 2026
En ny analyse fra OpenAI afslører kritiske svagheder i SWE-Bench Pro, som bruges til at måle AI-modellers evne til softwareudvikling. For tekniske ledere betyder det, at de nuværende ranglister over AI-værktøjer kan være misvisende, og at vi har brug for mere præcise metrikker for at vurdere den reelle forretningsværdi af AI-kodning.
Key Intelligence
•OpenAI har fundet betydelige mængder 'støj' i SWE-Bench Pro, som forvrider evalueringen af LLM-modeller.
•Mange testopgaver i benchmarken er enten uløselige eller har mangelfulde tests, hvilket straffer ellers kapable AI-modeller.
•Analysen viser, at selv små fejl i evalueringen kan føre til store forskelle i, hvordan modeller som GPT-4o eller Claude rangeres.
•Det er nu sværere for CTO'er at træffe valg baseret udelukkende på offentlige benchmarks, da tallene ikke altid afspejler virkelighedens kodningsevner.
•OpenAI foreslår en mere stringent tilgang til evaluering for at sikre, at AI-udviklingen bevæger sig i den rigtige retning.
•Vidste du, at op mod en betydelig del af test-cases i populære benchmarks kan indeholde fejl, der gør dem umulige for en AI at løse korrekt?