Компания Anthropic представила новую ИИ-модель под названием Claude 3.7 Sonnet, которая умеет "размышлять" над вопросами столько, сколько захочет пользователь. Правда, если пользователь бесплатный — то размышления ему не положены.
Anthropic называет свою новинку "первой в индустрии гибридной моделью ИИ-рассуждений". Что это значит? В отличие от большинства ботов, которые либо выдают быстрые (и часто глупые) ответы, либо долго "обдумывают", Claude 3.7 Sonnet делает и то, и другое в одном флаконе. Пользователь сам решает, включать ли режим "размышлений" — чем дольше думает бот, тем сложнее и точнее будет ответ.
Главная идея: убрать из интерфейсов этот муторный выбор моделей, когда ты не знаешь, какую взять — подешевле или покруче. Anthropic хочет, чтобы одна универсальная модель справлялась со всем.
Кому что достанется?
Claude 3.7 Sonnet запускается для всех пользователей и разработчиков, но с нюансами:
- Платники (премиум-подписчики Claude) получат полноценный доступ ко всем режимам размышлений.
- Бесплатные пользователи получат версию без "размышлялок", но Anthropic уверяет, что даже она круче, чем прошлый Claude 3.5 Sonnet.
- Кстати, номер 3.6 в линейке пропустили — видимо, слишком торопились.
Цена вопроса
Claude 3.7 Sonnet стоит:
- $3 за 1 млн входных токенов (примерно 750 000 слов, то есть больше, чем весь "Властелин колец")
- $15 за 1 млн выходных токенов
Это дороже, чем у OpenAI o3-mini ($1.10 за 1 млн входных / $4.40 за 1 млн выходных) и DeepSeek R1 (55 центов / $2.19). Но тут надо понимать: o3-mini и R1 — это чистые модели рассуждений, а Claude 3.7 Sonnet — гибрид, который умеет и быстро отвечать, и глубоко думать.
Что нового в "мыслях" Claude?
Claude 3.7 Sonnet — это первый "думающий" ИИ от Anthropic. Подход в духе дедукции: разбивает сложные вопросы на простые шаги, поэтому ответы получаются точнее.
Раньше модели ИИ улучшались за счет прокачки железа, но этот подход уже уперся в потолок. Теперь компании вроде OpenAI, Google и Anthropic делают ставку на разумные размышления. Например:
- o3-mini (OpenAI),
- R1 (DeepSeek),
- Gemini 2.0 Flash Thinking (Google),
- Grok 3 (Think) от xAI (Илонушка тоже в деле).
Anthropic хочет, чтобы в будущем Claude сам решал, сколько ему думать над вопросом. В идеале — чтобы пользователю вообще не нужно было париться с кнопками.
Как это выглядит? У Claude 3.7 Sonnet появился "видимый черновик" — в интерфейсе можно наблюдать, как он рассуждает. Но не всегда: иногда Anthropic будет скрывать часть размышлений по соображениям безопасности.
Как Claude 3.7 Sonnet справляется с реальными задачами?
Anthropic говорит, что модель стала на 45% реже отказывать в ответах на вопросы. Теперь она лучше отличает опасные запросы от безобидных, а значит, будет меньше случаев, когда ИИ на всякий случай ничего не отвечает.
В тестах результаты тоже хорошие:
- Программирование (SWE-Bench) — 62,3% точности против 49,3% у OpenAI o3-mini.
- Работа с API и симуляция юзеров в ритейле (TAU-Bench) — 81,2% против 73,5% у OpenAI o1.
Еще появилась новая фишка — Claude Code. Это кодерский инструмент, который позволяет прямо из терминала запрашивать анализ проекта, редактировать код простыми текстовыми командами, тестировать его и даже отправлять на GitHub. Пока работает только для избранных по принципу "кто успел, тот и молодец".
Anthropic идет в атаку, но OpenAI не спит
Claude 3.7 Sonnet выходит на фоне гонки вооружений среди ИИ-компаний. Раньше Anthropic играла в осторожную и безопасную разработку, а теперь решила идти на передовую.
Но ненадолго. OpenAI уже тизерит свой гибридный ИИ, который должен выйти "в ближайшие месяцы". Так что Anthropic пока впереди, но гонка продолжается.