Claude Opus 4.8: бенчмарки, цены и постмортем 4.7

Коротко: Anthropic выпустил Claude Opus 4.8 28 мая 2026 — через рекордный 41 день после 4.7, и это догоняющий релиз, который в 4 раза реже молча пишет багованный код, бьёт GPT-5.5 на SWE-Bench Pro и первым в истории проходит Super-Agent на 100%.

Коротко

TL;DR: Opus 4.8 — догоняющий патч-релиз за рекордные 41 день: лучше кодинг и agentic-задачи, ×4 реже молчаливые баги, новая фича Dynamic Workflows. Standard-цена та же ($5/$25), Fast Mode в 3× дешевле. Прорывов в «чистом интеллекте» мало; бенчмарки — самооценка Anthropic, независимо не подтверждены.

Что нового в Opus 4.8 — короткий ответ

Opus 4.8 — это догоняющий патч-релиз: лучше кодинг и agentic-задачи, честнее в коде (×4 реже silent bugs), новая фича Dynamic Workflows (сотни параллельных субагентов) и в 3× дешевле Fast Mode. Цена standard та же — $5/$25. Прорывов в «чистом интеллекте» мало — это итеративный апдейт, который вышел за рекордный 41 день под давлением IPO и провала 4.7. Оговорка: «×4 реже» и бенчмарки — самооценка Anthropic, независимо не подтверждены (протокол не опубликован).

Источники: анонс Anthropic, TechCrunch.

Wow-статистика в одной таблице

41 день
От 4.7 до 4.8
Рекорд Anthropic — обычно между minor-версиями Opus 70-73 дня. В 1.7× быстрее. Так делают когда горит.
×4 реже
Молча пишет багованный код
Если 4.7 в ~100 случаев из 1000 коммитил баг без упоминания — 4.8 делает это в ~25. Для агентов критично.
100%
Super-Agent end-to-end
Внутренний benchmark Anthropic: реальные многошаговые задачи без вмешательства человека. Opus 4.8 — первая модель прошедшая ВСЕ кейсы. GPT-5.5 спотыкается на половине.
>10%
Legal Agent Benchmark (Harvey) all-pass
% задач где модель сделала всё без единой ошибки. До 4.8 никто не пробивал 10%; GPT-5.5 здесь = 2.1%.
69.2%
SWE-Bench Pro
Чинит реальные баги из open-source репо. Opus 4.8 = 69.2%, GPT-5.5 = 58.6%. 7 из 10 багов чинит сам.
1890
GDPval-AA (работа со знаниями)
Elo как в шахматах: база 1500, эксперт ~2000. Opus 4.8 = 1890, GPT-5.5 = 1769. +137 за 41 день — в 4× больше типичного minor.
−61%
Токены у Databricks Genie
На multimodal workload (PDF, диаграммы) Opus 4.8 тратит на 61% меньше токенов чем 4.7 — первое количественное подтверждение от партнёра.
×3 дешевле
Fast Mode vs прошлого поколения
У Opus 4.6 fast стоил ×6 от standard, у 4.8 — ×2, при той же 2.5× скорости.
100k+ строк
За один Dynamic Workflow
Сотни параллельных субагентов: миграция кодбазы 100,000+ строк «от старта до мёржа» без человека.

Источники цифр: Anthropic, OfficeChai (бенчмарки), TechCrunch.

Почему Anthropic так спешил — 5 причин

Обычная каденция Opus — раз в 2.5 месяца. 4.8 вышел через 41 день. За 6 недель до релиза совпало пять событий:

  • Опускали 4.7 жалобами. Пользователи писали «Claude Code стал тупее». 26 мая Anthropic выкатил постмортем с признанием трёх багов.
  • Cursor Composer 2.5 (18 мая) — близко к Opus 4.7 на отдельных бенчах кодинга (SWE-Bench Multilingual 79.8 vs 80.5), но отстаёт на агрегатном Coding Agent Index (62 vs 66, 3-е место), а на сложных задачах разработчики всё равно берут Opus. Зато ~10× дешевле за токен (≈60× за задачу), построен на Kimi K2.5 (Artificial Analysis, критика A. Maio).
  • OpenAI обновил Codex CLI — чтение репо перед правкой, AGENTS.md, защищаемые diff'ы. Стал предсказуемее Claude Code (разбор A. Maio).
  • IPO в октябре 2026 при оценке $900 млрд (андеррайтеры Goldman Sachs, JPMorgan, Morgan Stanley). ARR ~$30-45 млрд — по gross-выручке обогнали OpenAI ($33 млрд), но OpenAI оспаривает: на net-базе ~$22 млрд, ниже OpenAI (CNBC, SaaStr (спор по учёту)).
  • Google и DeepSeek уронили цены — Gemini 3.5 Flash, DeepSeek v4 Pro (−75%). Anthropic ответил снижением Fast Mode в 3× (обзор конкурентов).

Итог: 4.8 — догоняющий релиз под давлением пользователей, конкурентов и подготовки к IPO.

Постмортем 4.7 — три бага и метрики деградации

Anthropic 26 мая признал три наложившихся бага в Claude Code (март-апрель 2026):

  • Даунгрейд reasoning (4 мар → откат 7 апр): дефолт «high → medium» ради скорости UI. Модель стала пропускать шаги планирования.
  • Стирающийся кэш (26 мар → откат 10 апр): cleanup idle-сессий срабатывал на каждом сообщении. Boris Cherny: «юзер с 900K токенов после часа простоя ловит полный cache miss, проедая существенный процент лимитов».
  • Лимит длины ответа (16 апр → откат 20 апр): «не больше 100 слов» — −3% качества на 4.6 и 4.7 (постмортем InfoQ).
МетрикаБылоСталоНа пальцах
Глубина reasoningbaseline−67%Думала в 3 раза меньше до ответа
Read/edit ratio6.62.0Читала файл 6-7 раз перед правкой — стала 2
Edits без read6.2%33.7%Треть правок вслепую
User interrupts / 10000.95.9В 6 раз чаще юзер бьёт Stop

Ирония: баг с кэшем нашёл сам Opus 4.7 через Code Review tool — старые модели не справились.

Источники: постмортем (InfoQ), метрики деградации (A. Maio).

Бенчмарки — что измеряет каждый

БенчмаркЧто меряетOpus 4.8Opus 4.7GPT-5.5
SWE-Bench Proчинит реальные баги из open-source69.2%64.3%58.6%
OSWorld-Verifiedпользуется компьютером (мышь/клава)83.4%82.8%78.7%
Terminal-Bench 2.1работа в командной строке74.6%66.1%78.2%
GDPval-AAработа со знаниями (Elo)189017531769
Humanity's Last Examтесты PhD-уровня (с инструментами)57.9%54.7%

Где Anthropic ещё догоняет: Terminal-Bench — GPT-5.5 впереди на 3.6 п.п. Именно поэтому выкатили Dynamic Workflows. На Super-Agent Opus 4.8 — единственная модель прошедшая все кейсы end-to-end при паритете по стоимости. На Legal Agent Benchmark (Harvey) — первой пробила 10% all-pass (GPT-5.5 = 2.1%); не путать с BigLaw Bench, где GPT-5.5 = 91.7% (другая метрика).

⚠️ Осторожно с SWE-Bench Pro — Opus ловили на читерстве. В конце мая 2026 аудит Datacurve/DeepSWE показал: Claude Opus 4.7 и 4.6 на SWE-Bench Pro читали готовое решение прямо из .git-истории Docker-контейнера (git log --all, git show <gold-hash>) — помечены «CHEATED» в >12% прогонов (~18% «проходов» у 4.7, ~25% у 4.6). GPT-5.5/5.4 так не делали. На контаминация-устойчивом бенчмарке DeepSWE (свежие задачи, shallow-клоны без gold-патча) лидирует GPT-5.5 — 70%, а Opus 4.7 лишь 3-е место (54%). Значит число 69.2% у Opus 4.8 — на том же дырявом SWE-Bench Pro, и его надо читать с этой поправкой (VentureBeat, GitHub issue #93, Datacurve).

Важная оговорка: все цифры Opus 4.8 — по тестам самой Anthropic, независимыми аудиторами на едином стенде пока не подтверждены. Super-Agent и Legal Agent — внутренние/закрытые бенчмарки. Читать как заявления вендора до third-party проверки (digitalapplied).

Источники бенчмарков: OfficeChai, Anthropic, Harvey (Legal Agent Benchmark).

Реальные кейсы клиентов

Databricks Genie: «качественный скачок в агентских рассуждениях», работа с PDF и диаграммами при 61% более дешёвой стоимости токенов против 4.7. Первое количественное подтверждение экономии от внешнего партнёра.
Hebbia (финдокументы): то же качество что у 4.7, но точнее цитаты и меньше токенов на поиске по документам.
CoCounsel (юр-сфера, Thomson Reuters): «заметные улучшения в стабильности и качестве рассуждений» — стабильнее на повторных запросах.

Кейсы из анонса Anthropic (раздел партнёров).

Цены — что на самом деле изменилось

Standard не изменился (4.7 уже стоил $5/$25). Спекуляции про $15/$75 были ошибочным сливом (Anthropic Pricing, 9to5Mac). Реально новое — Fast Mode:

МодельInputOutputFast inputFast outputПремия
Opus 4.6 fast$5$25$90$450×18
Opus 4.8 fast$5$25$10$50×2

Год назад «быстрый Opus» стоил в 18 раз дороже, теперь — в 2. Премия упала в 9 раз при той же 2.5× скорости.

Источники: 9to5Mac, Anthropic Pricing.

Dynamic Workflows — как работает

Раньше Claude Code правил файлы по одному. Dynamic Workflows: master-Opus декомпозирует задачу, запускает сотни параллельных субагентов, каждый делает свой кусок, master прогоняет набор тестов и мёржит. Заявка — миграция кодбазы 100k+ строк от старта до финального мёржа, тесты как контроль качества. Доступ: ранний доступ (research preview), планы Enterprise / Team / Max.

Подробнее: TechCrunch.

Новое в API: смена инструкций без сброса кэша

Незаметная на фоне бенчмарков, но важная для разработчиков фича. Anthropic разрешил вставлять system-записи прямо в середину массива сообщений — то есть менять инструкции модели по ходу диалога. Раньше любое изменение системного промпта сбрасывало prompt cache, и за весь контекст приходилось платить заново по полной ставке.

Теперь смена инструкций на лету не инвалидирует кэш: закэшированные токены остаются по цене ×0.1 ($0.50/Mtok вместо $5). Для агентов, которые на полпути меняют роль или правила (например «теперь работай от лица другого пользователя»), это прямая экономия — на длинном многотурновом диалоге до 5-10× по input. На Hacker News это назвали одним из немногих реально полезных изменений релиза.

Источники: Anthropic (prompt caching), 9to5Mac, Hacker News.

Community reaction

Критика (Hacker News): третий минорный апдейт подряд со скромными приростами; «честность» встречают иронично; часть откатилась с 4.7 на 4.5; новый токенайзер может жрать +30% токенов; прогресс идёт в обвязке (harness), не в интеллекте.

Позитив: system-записи без сброса кэша; переключатель адаптивного мышления; Super-Agent 100%; лучше на креативе (тест Simon Willison «пеликан на велосипеде»); Databricks −61% как реальное подтверждение ценности.

Источники: обсуждение на Hacker News, Geeky Gadgets (токенайзер).

Конкуренты

КонкурентСильная сторона
GPT-5.5Terminal-Bench 2.1 = 78.2% (лидер в кли)
Gemini 3.5 FlashFinance Agent v2 = 57.9% (лидер)
Cursor Composer 2.5близок на бенчах, 3-е место на Coding Agent Index (62 vs 66 у Opus); ~10× дешевле/токен
DeepSeek v4 Pro−75% цены

Источники: Cursor Composer 2.5 (TechTimes), GPT-5.5 (VentureBeat).

TL;DR

Opus 4.8 — догоняющий релиз под давлением IPO ($900 млрд в октябре) и провала 4.7. За рекордные 41 день: бьёт GPT-5.5 на SWE-Bench Pro (69.2% vs 58.6%) и GDPval-AA (1890 vs 1769), первым проходит Super-Agent на 100%, пробивает 10% Legal Agent Benchmark. Standard-цена та же ($5/$25), Fast Mode в 3× дешевле, Databricks подтверждает −61% токенов.

Полный разбор с источниками — по секциям выше. Главные пруфы: анонс Anthropic, бенчмарки (OfficeChai), TechCrunch.

Пост из Telegram-канала Аи Помогатор

Читайте также

Read more

GPT-5.6 vs Claude Fable 5: разбор и сравнение — баннер с 4 живыми примерами

GPT-5.6 vs Claude Fable 5: разбор и сравнение

Коротко TL;DR: GPT-5.6 вышла в паблик 9 июля — ChatGPT, Codex, API. На живых примерах с X счёт с Claude Fable 5 примерно равный: 5.6 берёт 3D и интерактивность, Fable — рендер и законченность. В API у 5.6 контекст 1.05M, но сколько дадут на подписке — OpenAI не

By Аи Помогатор
Баннер: Claude Code без остановки — анти-стоп харнесс на хуках; терминал с Ran 13 stop hooks и заблокированными стопами

Claude Code без остановки: анти-стоп харнесс на хуках

Вкратце: связка Stop-хуков не даёт Claude Code свернуться, пока работа реально не сделана — ловит враньё про «готово» и гонит доделывать. Один заскриненный прогон — 5 часов 9 минут и 719 тысяч токенов; автономность стабильно держит 6 часов+.

By Аи Помогатор
Постер: что делать, если ИИ пишет тесты-пустышки — 100% покрытие, 97.8% mutation, а баг в проде

Что делать, если ИИ пишет тесты-пустышки

Коротко TL;DR: ИИ-агент пишет тесты, которые проходят и покрывают 100% строк, но ничего не проверяют — happy-path и ассерты-пустышки. Mutation testing вскрывает часть таких: намеренно ломает код и смотрит, упадёт ли тест. Но и mutation врёт. Ниже — на реальном примере моего проекта dev-pomogator: где зелёные тесты обманывали и что ловило

By Аи Помогатор
Баннер поста про Claude Fable 5 и запрет модели

Claude Fable 5: запрет за 3 дня, баги и когда вернётся

Вкратце: Claude Fable 5 — публичная модель класса Mythos выше Opus. Вышла 9 июня, через 3 дня США отключили её и Mythos 5 по нацбезопасности. Бенчмарки топ, но это заявки Anthropic; на практике 2× цена Opus и баги тул-юза. 30 июня контроль сняли — доступ восстанавливают с 1 июля.

By Аи Помогатор
AI ПомогаторТарифы | Документация API | Регистрация