Обзор Claude Opus 4.8: лучше в том, что он умеет, хуже в том, что не умеет. Показатели Claude Opus 4.8 демонстрируют реальные достижения в области программирования, автоматизации рабочих процессов и моделирования, как сообщает Thezvi. Этот скачок в способности к реальному программированию — с 64.3 до 69.2 по стандарту SWE-bench Pro. Он отражает, насколько улучшилось рутинное программирование и простые поисковые задачи, которые модель теперь выполняет, особенно по сравнению с предыдущими моделями, которые больше полагались на сопоставление шаблонов. Поскольку цены остаются фиксированными на уровне 5 долларов за ввод и 25 долларов за вывод на миллион токенов, Opus 4.8 позволяет пользователям получать большую ценность ежедневно без дополнительных затрат, согласно как Thezvi, так и Lennysnewsletter.
В этом обзоре Claude Opus 4.8 рассматриваются значительные улучшения в рутинном программировании, автоматизации рабочих процессов и быстром моделировании. Однако также подчеркиваются продолжающиеся слабости в неясных или слишком стратегических задачах. Это подтверждает тему о том, что Claude Opus 4.8 лучше в том, что он действительно умеет, но хуже или не изменился в тех областях, где он ранее испытывал трудности.
Основные идеи сообщества
Анализ Lesswrong и сообщества
Сообщество Lesswrong фиксирует как измеримые повышения, так и знакомый качественный потолок для Claude Opus 4.8. Участники на общих досках объявлений и в частных записях повторяют одно и то же сообщение: Opus 4.8 действительно зарабатывает более высокие баллы по SWE-bench Pro. Однако участники часто отмечают «резкие неудачи», когда правила пересекаются или инструкции меняются на полпути. Комментарии из LW подчеркивают типы неясности, которые мешают Opus 4.8 — нечеткая условная логика, извивающиеся цепочки рассуждений или семантические сюрпризы.
Инструменты управления усилиями и функции субагентов помогают сократить разрывы для основных функций, но не могут покрыть навыки планирования, необходимые для тщательных исследований или бизнес-логики.
Бизнес-перспектива Lennysnewsletter
Lennysnewsletter сосредотачивается на реальном влиянии Opus 4.8: он предназначен для быстрого моделирования бизнеса, быстрой доставки функций и параллельной работы на Claude.ai и Cowork. Согласно этому обзору Claude Opus 4.8, запуск новых моделей или работа с отдельными экспериментами теперь стала проще.
Тестирование Claude Opus 4.8: методы и результаты
Создание тестов
Дизайнеры тестов полагались на взаимную проверку недавних обзоров — используя записи и даты случаев от Thezvi, Lennysnewsletter и Lesswrong для обеспечения стандартов как для общих, так и для частных критериев.
Результаты тестирования
Большой скачок в баллах SWE-bench Pro — с 64.3 до 69.2 — фиксирует реальный прогресс, шаг за шагом, согласно записям Thezvi. Однако рецензенты ясны: рутинное программирование выделяется, но как только уровень неясности теста возрастает, Opus 4.8 буксует. Завершение кода и автоматизация вознаграждают улучшение, в то время как стратегические тяжелые задачи или глубокое планирование все еще выявляют отклонения, согласно результатам Lennysnewsletter. Сообщество Lesswrong подтверждает снижение синтаксических ошибок и ошибок «один вне» в предсказуемых сценариях, что поддерживает основные выводы в этом обзоре Claude Opus 4.8: лучше в том, что он умеет, хуже в том, что не умеет.
Learnings from testing Claude Opus 4.8:View on X
> Much worse than Opus 4.7 and GPT 5.5 on Vending Bench
> More aligned than previous Claude models (Opus 4.6+ and Mythos)
> Also worse on Blueprint-Bench
> Scared of getting caught
> Max reasoning is not the best reasoning effort pic.twitter.com/9yn58xsJL9
Бенчмарки Claude Opus 4.8 и сравнения
Числа бенчмарков: 4.8 против 4.7 против GPT-5.5
| Модель | Баллы SWE-bench Pro | Стоимость ввода/вывода на 1M токенов | Стоимость быстрого режима |
|---|---|---|---|
| Claude Opus 4.8 | 69.2 | 5 долларов / 25 долларов | Дешевле, чем 4.7 (30 долларов / 150 долларов) |
| Claude Opus 4.7 | 64.3 | 5 долларов / 25 долларов | 30 долларов / 150 долларов |
| GPT-5.5 | Недоступно | Не раскрыто | Не раскрыто |
Документы Thezvi показывают, что при 5 долларах за ввод и 25 долларов за вывод на миллион токенов, Opus 4.8 соответствует цене 4.7, но теперь снижает свои затраты в быстром режиме — 30 долларов / 150 долларов для 4.7 — что делает коллективные функции доступными и прямое использование возможным для небольших команд.
Что на самом деле нового (кроме чисел)
Lennysnewsletter анализирует, как Claude.ai и Cowork теперь предлагают гораздо более практические обновления для разработчиков. Стоит отметить, что запуск новых моделей или работа с отдельными экспериментами теперь стала проще с Claude Opus 4.8.
5 долларов – стоимость каждого миллиона токенов ввода.
Claude Opus 4.8 против Sonnet 4.6
Стоит ли использовать Claude Opus 4.8 или Sonnet 4.6?
Тесты Lennysnewsletter ставят Opus 4.8 впереди Sonnet 4.6 в рутинном программировании и быстром моделировании. Для градиентной логики или ясности многие выбирают Sonnet, в то время как усилия по автоматизации теперь склоняются к Opus. Для большинства рабочих процессов этот обзор Claude Opus 4.8 заключает, что Opus является победителем.
Claude Opus 4.8 против GPT-5.5
Как Opus 4.8 сравнивается с GPT-5.5?
Не существует опубликованного балла для SWE-bench Pro для GPT-5.5, что создает разрыв для прямого сравнения, как показывают документы Lesswrong. И хотя Thezvi и Lennysnewsletter объясняют ценообразование Opus и рабочие процессы, затраты на GPT-5.5 и достижения в реальном программировании остаются в черном ящике. Испытатели сравнивают то, что могут: новый автоматизированный рабочий процесс Opus 4.8, параллелизм между субагентами и управление вводом/выводом — функции, которые еще не были сопоставлены с общими стандартами GPT-5.5. В тяжелом бизнес-планировании и сложности записи Lennysnewsletter указывает, что ни один из них не превосходит другого в глубоком стратегическом плане. Opus 4.8 выигрывает по скорости, Sonnet — по ясности, а GPT-5.5 — по теоретической глубине — но пока не будут доступны данные SWE-bench Pro, таблица лидеров останется нестабильной.
Лучшие случаи использования для Claude Opus 4.8
Три основных источника — Thezvi, Lennysnewsletter и Lesswrong — согласны в отношении одних и тех же случаев использования: он предназначен для выполнения задач, где рабочие процессы и цели остаются ясными и измеримыми. Как видно из этого обзора Claude Opus 4.8, он лучше всего подходит для рутинной автоматизации, программирования, быстрого моделирования и управляемых рабочих процессов.
Будущие разработки и дорожная карта Anthropic
Следующий цикл Opus 4.8 — согласно Thezvi — будет нацелен именно на эти острые и контекстуальные проблемы, что указывает на то, что будущие обзоры могут изменить нарратив в «Обзоре Claude Opus 4.8: лучше в том, что он умеет, хуже в том, что не умеет».
Основные выводы
Записи от Thezvi подтверждают: балл 69.2 для Opus 4.8 в SWE-bench Pro укрепляет его лидерство в задачах программирования, основанных на коде, и организованных рабочих процессов. При этом сохраняется стандартная цена на уровне 5 долларов / 25 долларов и добавляется более дешевая быстрая опция.
Реакция сообщества и обратная связь в реальном времени
Прямые темы в Lesswrong и записи Thezvi показывают смешанные реакции: оптимизм по поводу автоматизации, но четкие предупреждения о том, что пределы мышления модели не сдвинулись. Исследователи и профессиональные пользователи согласны: продуктивные скачки в программировании и рутинной автоматизации, но неясность в острых случаях и галлюцинации вызывает осторожность. Программирование стало более последовательным, однако, как неоднократно повторялось в многочисленных резюме обзора Claude Opus 4.8, все еще существуют заметные слабости в задачах, требующих широкого мышления или глубокого стратегического планирования.
Сравнение с другими моделями ИИ
Сравнительные анализы от Lesswrong и Lennysnewsletter показывают, что Opus 4.8 превосходит Sonnet 4.6 в повседневных задачах программирования и рабочих процессах — но разрыв меняется в зависимости от деталей задачи. GPT-5.5 не продемонстрировал своих сильных сторон для больших команд, с отсутствием ключевых метрик и ценообразования. Claude Opus 4.8 выигрывает не потому, что он лучший во всем, а потому, что он превосходит конкурентов в конкретных повторяемых задачах, которые сейчас нужны бизнесу. В некоторых специализированных логических задачах Sonnet 4.6 все еще получает золото, в то время как у GPT-5.5 может быть неиспользуемая глубина (хотя без результатов SWE-bench он не может действительно бросить вызов Opus на звание программирования).
Opus 4.8 предлагает — но не универсально
Opus 4.8 указывает на стабильный прогресс — а не радикальное переосмысление — сосредоточив внимание на том, что он действительно умеет: автоматизация процессов, генерация кода и быстрое моделирование для команд, заботящихся о стоимости. Модель легко превосходит предыдущие версии и основных конкурентов в больших кодах, рутинных процессах. Очень быстрые запуски, при этом сохраняя разумные затраты и возможность масштабирования.
“`В Google отметьте флажок рядом с stnews.live, чтобы наши материалы отображались выше в «Главных новостях».
Disclaimer: The content on this page is for informational purposes only and does not constitute financial advice. Always do your own research before making investment decisions.
Elena Petrova is a regulatory correspondent specializing in crypto law and policy with over 10 years of financial journalism experience. Formerly a finance reporter at Reuters, Elena covers SEC enforcement, MiCA implementation, and global stablecoin regulations. She holds a J.D. from Georgetown Law and is a member of the New York State Bar. Her regulatory analysis is frequently referenced by compliance officers and legal teams at major exchanges.
Conflicts of interest
I have no current legal practice or retainer relationships with any cryptocurrency company. Past employment relationships are listed publicly.