Как индустрия меряет ИИ сломанной линейкой 📐

Каждый релиз новой LLM сопровождается цветастыми графиками, где столбик с надписью SWE-bench упирается в небеса. Маркетологи визжат: «Модель автономно решает 80% задач разработки, программистам приготовиться!».
А теперь следите за руками.
Уже давненько OpenAI выпустили разбор, где фактически хоронят бенчмарк SWE-bench Verified. Основные причины две:
1️⃣ Контаминация (утечка данных).
Задачи для бенчмарка парсили из закрытых issue и pull requests открытых репозиториев на GitHub. Очевидно, что эти же репозитории разработчики пылесосили при обучении своих моделей. Это как дать студенту правильные ответы до экзамена, а потом восхищаться его гениальностью. Во время проверок модели дословно генерировали gold patch — куски кода с точными названиями переменных и специфичными комментариями из оригинальных пулл-реквестов. Они не «решали» задачу, они её вспоминали.
2️⃣ Узкие тесты.
Почти 60% сложных задач тупо браковали функционально правильный код. Нейронка решила проблему, но назвала новую функцию не так, как этого хотел оригинальный автор 5 лет назад? Тест упал, решение отклонено.
Тогда OpenAI сказали: «Ок, Verified — скомпрометирован, используйте SWE-bench Pro, там горизонт планирования шире и задачи реалистичнее».
⏩ И вот теперь OpenAI публикует новый аудит.
Спойлер: SWE-bench Pro тоже оказался мусором 🤡
Они прогнали датасет через пайплайн из своих агентов, посадили пять опытных инженеров проверять результаты руками и выяснили, что ~30% задач в «Pro» версии тупо сломаны.
Где-то скрытые тесты требуют два пробела для рендеринга Markdown, хотя в промпте в примере указан один пробел. Где-то проверяется функционал, о котором в постановке задачи вообще нет ни слова. В итоге OpenAI официально отозвали свою рекомендацию использовать этот бенчмарк.
В чём фундаментальная проблема?
Нельзя просто спарсить GitHub, натравить на него скрипт и получить идеальную метрику. Написание кода и ревью — это социальный процесс с кучей контекста. Тесты, которые пишут живые разработчики в конкретном PR, проверяют конкретную реализацию фичи или костыля, а не абстрактную алгоритмическую правильность решения проблемы.
Индустрия прямо сейчас измеряет возможности ИИ сломанной линейкой. Объективных публичных автоматизированных метрик для написания кода на данный момент не существует. Единственный выход — закрытые бенчмарки, созданные крутыми инженерами с нуля за очень много денег в условиях строжайшей секретности. И то, это вопрос времени, когда их сольют в обучающие выборки.
А пока разработчикам придётся доверять только одному бенчмарку — запуску модели на своей собственной рабочей кодовой базе.