SWE-bench Verified og måling af AI-kodning
SWE-bench Verified bruges til at måle, hvor godt AI-modeller løser softwarefejl, men OpenAI vurderer nu, at benchmarken er blevet for upræcis til frontier-sammenligninger. Du får overblik over, hvorfor testkvalitet, træningskontaminering og lokale kontrolkrav betyder mere end en enkelt topscore.