Что не так с GPT-5.6 Sol: первые баги новой эпохи
Привет, друзья!
Две недели с момента публичного релиза GPT-5.6 Sol — и уже можно честно сказать: модель отличная, но не без проблем. Делюсь тем, что заметила в работе с ней, плюс то, что собрала из отзывов сообщества.
Что работает отлично
Сначала про хорошее, потому что его много. Sol действительно умнее предыдущего поколения. На сложных агентских задачах — заметно меньше «уплывания» в сторону. Длинные цепочки рассуждений удерживаются стабильнее.
Кодинг стал сильнее. Особенно в режиме с max reasoning — там Sol реально догнал и местами обогнал Claude Opus 4.8 на сложных многофайловых задачах. Не идеально, но ощутимо.
Что не работает
1. Скорость деградирует в длинных сессиях
После 20-30 сообщений в одной беседе Sol начинает работать заметно медленнее. Это не баг в строгом смысле — это особенность контекстного окна. Но для production-использования критично: нельзя оставлять длинную сессию и возвращаться к ней через час.
Рабочее решение — отдельные сессии для отдельных задач. Неудобно, но это цена, которую мы пока платим за большие окна.
2. Цена кусается даже для топ-сегмента
Sol в режиме max reasoning — $30 за миллион output-токенов. Это втрое дешевле Fable 5, но всё равно серьёзные деньги для длинных workflow. Если вы делаете research-агента, который должен пройти 50 шагов, счёт может удивить.
Совет: для черновой работы используйте Terra, для финального прохода — Sol. Это даёт 80% качества за 30% стоимости.
3. Галлюцинации в длинных контекстах
Контринтуитивно, но факт: на длинных документах Sol иногда уверенно цитирует то, чего в тексте нет. Особенно это видно в технических документах с таблицами и графиками — модель «видит» то, что логически вытекает, но не существует буквально.
Рабочее решение: после Sol прогонять через более дешёвую модель (тот же Terra или Claude Sonnet) для фактчекинга. Двойная проверка стоит копейки по сравнению с исправлением последствий ошибки.
4. Tool calls иногда зацикливаются
В агентском режиме Sol иногда вызывает один и тот же инструмент несколько раз подряд с минимальными изменениями в параметрах. Это классическая проблема «застрял в петле». Fable 5 и Grok 4.5 с этим справляются лучше.
Рабочее решение: явно прописывать в спецификации «если инструмент вернул ошибку, попробуй другой подход, не повторяй тот же вызов».
5. Слабая работа с русским в длинных документах
На английском Sol прекрасен. На русском — заметно хуже, особенно в задачах, требующих понимания культурного контекста. Идиомы, юмор, отсылки к российским реалиям — всё это Sol обрабатывает хуже, чем Claude Fable 5 или даже Grok 4.5.
Рабочее решение: для русскоязычных задач пока лучше использовать Fable 5 или отечественные модели.
Сравнение с конкурентами
Если коротко — кто для чего:
- Sol — для агентских задач и сложного кодинга на английском
- Fable 5 — для русского, для длинного контекста, для аккуратных формулировок
- Grok 4.5 — для дешёвых массовых задач и коротких операций
Стоит ли переходить
Если вы уже работаете с GPT-5.5 или Sonnet 5 — переходите. Sol лучше по большинству метрик, особенно в агенте и коде. Цена — втрое дешевле Fable 5, что закрывает основной аргумент за Claude.
Если вы работаете с Fable 5 ради длинного контекста и качества русского — оставайтесь. Sol пока не закрывает эти кейсы.
Если вы только начинаете работать с топовыми моделями — берите Sol в качестве основной, держите Fable 5 как запасной вариант для специфических задач.
Что в сухом остатке
Sol — это лучшая модель OpenAI на сегодня, и одна из лучших в индустрии. Но это не значит, что она без проблем. У каждой топовой модели есть свои сильные и слабые стороны, и задача пользователя — знать их.
Не выбирайте одну модель на всё. Держите две-три под рукой и используйте каждую там, где она сильнее. Это уже не будущее AI — это его настоящее.
Комментарии ()