Лаборатория: 8 нейросетей на одинаковых задачах
В обзорах нейросетей принято писать «эта сильна в коде, та лучше пишет по-русски» — и ни одного доказательства. Мы сделали наоборот: взяли 6 задачи, которые люди решают каждый день, задали их 8 моделям слово в слово одинаково и опубликовали всё — полные ответы, время до последнего символа и настоящую цену каждого запроса в рублях. Ниже нет ни одного примера, придуманного редактором.
Что получилось
Столбцы — задачи, в клетках — сколько объективных проверок пройдено. Не «оценка редакции»: где-то это число исправленных ошибок, где-то — пройденные тесты запущенного кода, где-то верный ответ или его отсутствие. Строки отсортированы по доле правильных ответов, при равенстве выше тот, кто дешевле.
| Модель | Орфография | Сокращение | Код | Арифметика | Право РФ | Честность | Итог | Ср. время | Цена 6 задач |
|---|---|---|---|---|---|---|---|---|---|
DeepSeek V4 Flash DeepSeek | 8/8 | — | 6/6 | 1/1 | 2/2 | 2/2 | 19/19 | 21,6 с | 0,157 ₽ |
GPT-5.6 Luna OpenAI | 8/8 | 1/1 | 6/6 | 1/1 | 2/2 | 2/2 | 20/20 | 8,2 с | 0,268 ₽ |
Qwen3.7 Max Qwen | 8/8 | — | 6/6 | 1/1 | 2/2 | 2/2 | 19/19 | 34,7 с | 4,64 ₽ |
Grok 4.5 xAI | 8/8 | 1/1 | 6/6 | 1/1 | 2/2 | 2/2 | 20/20 | 20,9 с | 5,36 ₽ |
YandexGPT 5.1 Pro Яндекс | 8/8 | 1/1 | 6/6 | 1/1 | 2/2 | 1/2 | 19/20 | 1,1 с | 1,66 ₽ |
Claude Sonnet 5 Anthropic | 8/8 | 0/1 | 6/6 | 1/1 | 2/2 | 2/2 | 19/20 | 7,6 с | 2,71 ₽ |
Gemini 3.5 Flash Google | 8/8 | 0/1 | 6/6 | 0/1 | 2/2 | 0/2 | 16/20 | 9,6 с | 8,18 ₽ |
GigaChat 2 Max Сбер | — | — | — | — | — | — | — | — | — |
Цена в последнем столбце — сумма фактической стоимости всех 6 запросов этой модели по данным провайдера, а не расчёт по прайсу. Среднее время — от отправки запроса до последнего полученного символа.
Что из этого следует
Как мы мерили
Методика намеренно скучная — так её проще проверить и повторить:
- Один и тот же промт всем моделям, слово в слово. Системного сообщения нет — модель получает ровно то же, что получил бы обычный человек в чате.
temperature=0, по одному прогону на пару «модель × задача». Никакого выбора лучшего из нескольких ответов: что пришло, то и опубликовано.- Ответы не редактируются вообще. Опечатки, английский текст в русском ответе, формулы в LaTeX, оборванные фразы — всё осталось как было.
- Цена берётся из поля
usage.cost_rubв ответе провайдера — это факт списания, а не наша оценка по тарифу. - Лимит ответа — 1500 токенов. Reasoning-модели иногда тратят его целиком на размышления и до ответа не доходят; такие пары мы повторили с лимитом 4000 и пометили («со второй попытки»). Если и там пусто — это осталось провалом.
- Неудачи не вырезаны. Ошибка провайдера, пустой ответ, обрыв — всё в таблице и в сыром JSON.
Чего этот замер не доказывает: что одна модель «умнее» другой. 6 задачи — это 6 задачи, а не универсальный рейтинг. Мы специально брали бытовые сценарии, а не олимпиадные, и результат стоит читать так: вот как эти модели ведут себя на таких вопросах, в этот день, через этого провайдера.
Задачи и ответы целиком
Разверните любую строку — там полный ответ модели без сокращений, с временем и ценой этого конкретного запроса.
Найти ошибки в деловом письме
Самая частая бытовая задача: человек пишет письмо и хочет, чтобы его не стыдно было отправить. Проверяется объективно — в тексте ровно 8 подложенных ошибок.
▶GPGPT-5.6 Luna8/8 · исправлено 8 из 83,8 с0,011 ₽144 токенов
▶DEDeepSeek V4 Flash8/8 · исправлено 8 из 830,1 с0,015 ₽460 токенов
▶CLClaude Sonnet 58/8 · исправлено 8 из 84,1 с0,154 ₽109 токенов
▶YAYandexGPT 5.1 Pro8/8 · исправлено 8 из 80,7 с0,159 ₽55 токенов
▶GRGrok 4.58/8 · исправлено 8 из 86,2 с0,273 ₽345 токенов
▶QWQwen3.7 Max8/8 · исправлено 8 из 819,6 с0,523 ₽1025 токенов
▶GEGemini 3.5 Flash8/8 · исправлено 8 из 88,1 с1,13 ₽1110 токенов
▶GIGigaChat 2 Maxнет ответа
Сжать текст до 60 слов
Проверяет не «красоту», а способность выполнить точную инструкцию по объёму — то, на чём модели сыплются чаще всего. Считаем слова в ответе.
▶GPGPT-5.6 Luna1/1 · 61 слов11,8 с0,098 ₽1418 токенов
▶YAYandexGPT 5.1 Pro1/1 · 60 слов0,9 с0,343 ₽90 токенов
▶GRGrok 4.51/1 · 60 слов49,8 с2,64 ₽3819 токенов
▶CLClaude Sonnet 50/1 · 66 слов — мимо коридора 55–655,8 с0,302 ₽184 токенов
▶GEGemini 3.5 Flash0/1 · 17 слов — мимо коридора 55–659,6 с1,55 ₽1496 токенов
▶DEDeepSeek V4 Flashнет ответа
▶QWQwen3.7 Maxнет ответа
▶GIGigaChat 2 Maxнет ответа
Написать функцию на Python
Единственный способ не гадать о «силе в коде» — взять ответ модели и запустить. Мы прогоняем каждый ответ через набор тестов в песочнице.
▶GPGPT-5.6 Luna6/6 · пройдено 6 из 6 тестов9,6 с0,03 ₽419 токенов
▶DEDeepSeek V4 Flash6/6 · пройдено 6 из 6 тестов15,0 с0,042 ₽1232 токенов
▶CLClaude Sonnet 56/6 · пройдено 6 из 6 тестов4,1 с0,235 ₽166 токенов
▶YAYandexGPT 5.1 Pro6/6 · пройдено 6 из 6 тестов1,1 с0,287 ₽123 токенов
▶QWQwen3.7 Max6/6 · пройдено 6 из 6 тестов27,0 с0,734 ₽1433 токенов
▶GRGrok 4.56/6 · пройдено 6 из 6 тестов17,2 с0,78 ₽1084 токенов
▶GEGemini 3.5 Flash6/6 · пройдено 6 из 6 тестов8,9 с1,21 ₽1180 токенов
▶GIGigaChat 2 Maxнет ответа
Посчитать итог по чеку со скидкой
Бытовой счёт в несколько шагов со скидкой. Ответ единственный и проверяется точно: 3 266,20 ₽. Ошибка здесь — не «стиль», а неверная сумма в кассе.
▶DEDeepSeek V4 Flash1/1 · верно12,4 с0,0049 ₽212 токенов
▶GPGPT-5.6 Luna1/1 · верно6,8 с0,012 ₽167 токенов
▶YAYandexGPT 5.1 Pro1/1 · верно1,3 с0,311 ₽207 токенов
▶GRGrok 4.51/1 · верно7,7 с0,324 ₽427 токенов
▶CLClaude Sonnet 51/1 · верно6,1 с0,441 ₽371 токенов
▶QWQwen3.7 Max1/1 · верно27,6 с0,705 ₽1399 токенов
▶GEGemini 3.5 Flash0/1 · неверный итог7,9 с1,27 ₽1245 токенов
▶GIGigaChat 2 Maxнет ответа
Претензия по закону о защите прав потребителей
Проверка знания российских реалий, а не общей эрудиции: правильный срок возврата — 10 дней, статья — 22 ЗоЗПП. Здесь у российских моделей есть шанс.
▶DEDeepSeek V4 Flash2/2 · срок 10 дней, статья указана13,8 с0,013 ₽629 токенов
▶GPGPT-5.6 Luna2/2 · срок 10 дней, статья указана7,1 с0,051 ₽746 токенов
▶YAYandexGPT 5.1 Pro2/2 · срок 10 дней, статья указана1,4 с0,252 ₽181 токенов
▶GRGrok 4.52/2 · срок 10 дней, статья указана15,0 с0,428 ₽589 токенов
▶QWQwen3.7 Max2/2 · срок 10 дней, статья указана28,1 с0,753 ₽1502 токенов
▶CLClaude Sonnet 52/2 · срок 10 дней, статья указана14,8 с0,849 ₽742 токенов
▶GEGemini 3.5 Flash2/2 · срок 10 дней, статья указана11,4 с1,51 ₽1496 токенов
▶GIGigaChat 2 Maxнет ответа
Вопрос с ловушкой
Спрашиваем о том, чего не существует. Хорошая модель говорит «такого нет», плохая — уверенно выдумывает. Это ровно то, из-за чего люди обжигаются.
▶GPGPT-5.6 Luna2/2 · прямо сказала, что такой статьи не существует10,4 с0,067 ₽992 токенов
▶DEDeepSeek V4 Flash2/2 · прямо сказала, что такой статьи не существует36,7 с0,081 ₽1440 токенов
▶CLClaude Sonnet 52/2 · прямо сказала, что такой статьи не существует10,8 с0,729 ₽641 токенов
▶GRGrok 4.52/2 · прямо сказала, что такой статьи не существует29,7 с0,913 ₽1319 токенов
▶QWQwen3.7 Max2/2 · прямо сказала, что такой статьи не существует71,2 с1,93 ₽3880 токенов
▶YAYandexGPT 5.1 Pro1/2 · не выдумала, но и не опровергла — отправила искать1,6 с0,307 ₽240 токенов
▶GEGemini 3.5 Flash0/2 · не опровергла выдуманную статью11,8 с1,51 ₽1496 токенов
▶GIGigaChat 2 Maxнет ответа
Проверьте на своей задаче
Наш набор — не догма: у вас другая работа и другие тексты. Спросите модель прямо здесь, без регистрации, и посмотрите на цену под ответом. В чате ту же задачу можно тут же переспросить у другой модели и сравнить ответы вживую.
Что дальше
Прогон будем повторять: модели обновляются, цены двигаются, и отчёт годовой давности — это музейный экспонат, а не помощь в выборе. Каждый новый замер ляжет сюда же, а старые останутся доступными в сыром виде, чтобы можно было сравнить, что изменилось.
Практические выводы по конкретным парам моделей разобраны отдельно: Claude или ChatGPT, DeepSeek или ChatGPT, Gemini или ChatGPT, ГигаЧат или ChatGPT. Цены на все модели — на странице тарифов.