Дайте нейросети стартап, и она обанкротит его за месяц 📉
Агенты уже умеют закрывать тикеты и править локальные баги в коде, но это — задачи с коротким горизонтом. Сделал действие -> сразу получил фидбек. В реальном бизнесе так не работает. Решения имеют отложенные последствия, информация зашумлена, а правила игры меняются на лету.
Исследователи из Принстона выкатили интересный бенчмарк для ИИ-агентов — CEO-Bench. Агенту дают 1 млн долларов стартового капитала, фиктивный AI-стартап и 500 дней на то, чтобы не сдохнуть.
Как работает мясорубка CEO-Bench 💼
Инструментарий: 34 метода через Python API, 19 SQL-таблиц (база юзеров, биллинг, саппорт), симуляция соцсетей, конкурентов и макроэкономики.
Среда симулирует то, от чего седеют реальные фаундеры и техлиды. У агента есть Python-интерфейс (novamind_api) с 34 метода через Python API, 19 SQL-таблиц (база юзеров, биллинг, саппорт), симуляция соцсетей, конкурентов и макроэкономики.
Что нужно делать:
🟢 Управлять ценами, квотами и R&D.
🟢 Распределять бюджет на таргет и инфраструктуру.
🟢 Закрывать enterprise-сделки (с многоходовыми торгами).
🟢 Разгребать нытье недовольных клиентов в соцсетях.
Главная фишка симуляции — отложенные последствия и скрытые переменные.
Агент не видит лояльность клиентов в виде цифры. Он должен выводить ее из косвенных метрик: оттока, тикетов в саппорт и постов в соцсетях. Закинул деньги в R&D сегодня? Результат будет непредсказуемым и через месяц. Сэкономил на серверах? Завтра ляжет прод, послезавтра enterprise-клиенты уйдут к конкурентам, а репутация на рынке пробьет дно.
Результаты: парад банкротств 💳
Давайте посмотрим на цифры из отчета. Разработчики протестировали зоопарк топовых моделей (включая Claude Fable 5, GPT-5.6 Sol и Qwen 3.7 Max).
Был написан простейший rule-based бейзлайн. Обычный скрипт на жестких правилах, который тупо льет фиксированный бюджет в R&D и таргет, опираясь на текущую нагрузку, и вообще не трогает цены. Этот кусок кода заработал $15.7M.
А теперь посмотрим на «интеллект» моделей:
🟠 Claude Fable 5 — $12.6M. Лучший из LLM, но все равно проиграл тупому скрипту.
🟠 GPT-5.6 Sol — $11.3M в лучшем прогоне, но в двух других из трех тупо обанкротился к 190 дню.
🟠 Claude Opus 4.8 — выжал $2.4M.
🟠 GPT-5.5 — $33k. Модель смогла раздуть базу юзеров, увидела кэш, решила порезать косты на инфраструктуру и качество, словила массовый отвал клиентов на продлении подписок и сожгла все деньги. Классический эффективный менеджмент 🌚
🟠 DeepSeek V4 Pro, Gemini 3 Flash, Grok 4.20 — не выжили ни в одном из прогонов. Твердый ноль на счету.

Почему LLM не умеют в стратегию? 😱
Анализ логов показывает: у моделей пока в зачаточном состоянии Steering Intelligence (навык управления системой во времени).
1️⃣ Игнорирование отложенных последствий. GPT-5.5 видит, что юзеры платят, и решает: «А давайте урежем квоты и сервера, чтобы поднять маржу!». Через месяц метрики качества падают, начинается шквал тикетов в саппорт, клиенты не продлевают контракты, стартап — труп. Агент просто не связывает свои действия в прошлом с катастрофой в настоящем.
2️⃣ Неумение парсить косвенные сигналы. В бенче нет таблички «истинная готовность платить». Есть гневные посты в соцсетях, графики оттока и история переговоров. Большинство моделей не понимают, что с этим делать, если им не разжевать проблему в промпте.
3️⃣ Отсутствие фокуса. Слабые модели рандомно дергают ручки: сегодня влили $100k в маркетинг, завтра поменяли цены, послезавтра закрыли R&D. Только топовые агенты (вроде Fable 5) догадываются писать собственные скрипты прямо внутри среды, чтобы симулировать отток когорт и прогнозировать кэш-флоу.
В общем, сложные такси из реальной жизни доверять моделькам рано. Да и многим людям тоже не стоит 🤣