Рейтинг ИИ-ассистентов для бизнеса в 2026 году: баллы по одинаковым задачам и честный минус победителя
Я прогнал одни и те же шесть критериев через пять ассистентов: ChatGPT, Claude, DeepSeek, YandexGPT и GigaChat. Ждал, что победит модель с лучшими результатами в тестах. Победила модель, которая тесты обычно не выигрывает. У победителя нашёлся и честный минус: он тянет назад ровно там, где остальные четыре сильнее. Дальше я объясняю, как считал баллы, показываю баллы по каждому критерию и свожу рейтинг ИИ-ассистентов к одному практическому вопросу: какой из них закроет именно вашу задачу, а не абстрактно «лучший в мире».
Как я считал баллы: шесть критериев вместо одного впечатления
Рейтинги ИИ-ассистентов в рунете чаще всего значат одно: автор попробовал каждого несколько минут и написал, что почувствовал. Это быстро. Это же и ненадёжно, ведь одно неудачное сообщение меняет всё впечатление. Я вместо этого взял шесть критериев, которые реально важны бизнесу, и задал одни и те же вопросы каждому ассистенту. За каждый критерий ассистент получает от 1 до 5 баллов. Баллы складываются, и так получается итоговый рейтинг.
- Деловой русский язык. Отвечает деловым тоном, без калек с английского и рекламных штампов.
- Работа с документами. Разбирает счёт, договор или письмо и вытаскивает из него нужные пункты.
- Таблицы и аналитика. Считает и сводит числа без ошибок в разрядах и итогах.
- Код и интеграции. Пишет рабочий сниппет под вызов CRM или другой системы.
- Доступ и оплата из РФ. Насколько просто подключить и оплатить сервис, не выходя за периметр обычных инструментов бизнеса.
- Хранение данных по 152-ФЗ. Остаются данные на серверах в России или уходят за рубеж.
Баллы ниже я поставил сам, не сверяясь с сертифицированным бенчмарком: у меня нет доступа к внутренним метрикам разработчиков моделей. Зато методика прозрачна. Повторите тест на своих вопросах и получите сравнимый результат.
Если критерии по отдельности интересуют вас больше, чем сумма баллов, я разбирал их подробнее в статье Нейросети для бизнеса: как выбрать под задачу: там же написано, чем каждое семейство моделей сильно и слабо.
Пять сценариев, которые я прогнал через каждого ассистента
Шесть критериев я проверяю не абстрактно, а на пяти конкретных сценариях, одинаковых для всех пяти ассистентов.
Первый сценарий — ответ клиенту. Прошу написать деловой ответ на типовое обращение: клиент спрашивает про сроки и цену, а обещанная дата уже сдвинулась. Здесь считается деловой русский язык, тон и отсутствие канцелярита.
Второй сценарий — разбор документа. Даю ассистенту счёт на оплату с десятком строк и прошу вытащить итоговую сумму, ставку НДС и срок оплаты. Ошибка в этом сценарии стоит бизнесу денег напрямую, поэтому здесь я не прощаю приблизительность.
Третий сценарий — сведение таблицы. Небольшая таблица расходов с несколькими статьями и вопрос на сумму и долю от общего расхода. Здесь я жду точный ответ, а не творческий.
Четвёртый сценарий — код интеграции. Прошу написать короткий сниппет, который отправляет данные заявки в CRM через её API, и смотрю, заработает ли он с первого раза без ручной правки синтаксиса.
Пятый сценарий — подключение. Прохожу путь обычного владельца бизнеса: регистрация, оплата, первый запрос к API. Считаю шаги, проверяю, нужна ли иностранная карта, и выясняю, где физически стоят серверы, которые обрабатывают запрос.
Пять сценариев и шесть критериев не бьются один к одному: сценарий с подключением закрывает сразу два критерия, доступ и хранение данных. Это осознанно, не натяжка методики. На практике оба вопроса бизнес решает в один момент, когда выбирает, кому платить и куда пойдут данные.
ChatGPT (OpenAI): 21 из 30
ChatGPT почти всегда попадает в тройку лидеров, если судить по качеству ответа. На деловом русском языке я поставил 4 из 5: модель иногда калькирует с английского. Это редкость. Документы и таблицы ChatGPT разбирает у меня на максимум, 5 и 5: уверенно вытаскивает пункты договора и не путает разряды, когда считает. На сценарии со счётом ни разу не ошибся в сумме и ставке НДС. Код тоже пишет на пятёрку.
Итоговые 21 из 30 портит не качество, а доступ. Официально оплатить ChatGPT из России сложно: нужен иностранный способ платежа или посредник. Данные при этом уходят на серверы за пределами страны. Если вы работаете с обезличенными данными и уже решили вопрос оплаты, это не страшно. Если процесс завязан на данные клиента, это стоп-сигнал.
Claude (Anthropic): 20 из 30
Claude идёт вплотную за ChatGPT почти по всем критериям. Деловой русский на 4, документы на 5. На таблицах и в многошаговом счёте я поставил на балл ниже, чем ChatGPT: именно на сценарии со сведением таблицы модель один раз потеряла промежуточную долю в середине расчёта, хотя финальный ответ почти всегда сходился. Код снова на пятёрку.
Слабое место то же самое, что у ChatGPT. Платить и получать доступ из России неудобно, данные уходят за рубеж. Оговорка та же: для обезличенных задач это не страшно, а вот передавать данные клиента без обезличивания уже значит нарушать 152-ФЗ.
DeepSeek: 17 из 30
DeepSeek я не жду в лидерах этого рейтинга, и он там действительно не лидирует. По деловому русскому ставлю 3: отвечает по делу, но реже держит ровный деловой тон, чем топовые универсальные модели. Документы и таблицы туда же, по 3: с типовыми случаями справляется, на нестандартной структуре путается. Код на 4: на сценарии с интеграцией сниппет заработал с первого раза, реже, чем у ChatGPT и Claude, но чаще, чем я ожидал за такую цену токена.
Доступ из РФ я оценил на 3: получить API у DeepSeek проще, чем у ChatGPT и Claude, иностранная карта не нужна. Но данные всё равно уходят за рубеж, поэтому по 152-ФЗ балл остаётся низким. Сумма 17 из 30 не делает DeepSeek худшим выбором. Она делает его конкретным выбором: берите DeepSeek, когда решаете много типовых недорогих задач и цена токена значит больше, чем последний процент качества.
YandexGPT и Алиса: 22 из 30
YandexGPT берёт высший балл за деловой русский язык, 5 из 5: модель обучалась на русскоязычных данных плотнее конкурентов, и это слышно в деловой переписке и коротких ответах. Доступ и хранение данных тоже на максимум: инфраструктура работает внутри России, платить можно через Yandex Cloud без иностранной карты.
А вот на многошаговых задачах видно обратное. Код и сложную аналитику я оценил на 2: сценарий с интеграцией модель не закрыла с первого раза, а на многошаговом счёте заметно уступает универсальным лидерам. 22 из 30 у YandexGPT набраны почти целиком на языке и доступе, а не на сложных задачах.
GigaChat: 24 из 30, победитель с честным минусом
GigaChat набрал больше всех, 24 из 30, и вот почему. Документы я оценил на максимум, 5: модель обучали прицельно под деловой документооборот, и это заметно, когда она разбирает счета и договоры. Деловой русский на 4, доступ и 152-ФЗ на максимум по той же причине, что у YandexGPT: инфраструктура и оплата работают внутри России. На сценарии со счётом GigaChat отработал не хуже ChatGPT, а вот сценарий с кодом интеграции пришлось чинить руками.
Честный минус у победителя, который я обещал в начале. Код у GigaChat я оценил на 2, ниже, чем у всех остальных, кроме такой же двойки у YandexGPT. Если основная нагрузка у вас — переписка и документы, а не код, это не помеха. Если ассистент должен писать или разбирать код, GigaChat здесь не лидер: переключитесь на ChatGPT или Claude именно для этой задачи, выйдет дешевле, чем тянуть код через модель, которая для него не создавалась.
Итоговая таблица: у кого больше баллов и какой у победителя минус
| Ассистент | Деловой рус | Документы | Таблицы | Код | Доступ из РФ | 152-ФЗ | Итого |
|---|---|---|---|---|---|---|---|
| GigaChat | 4 | 5 | 3 | 2 | 5 | 5 | 24 |
| YandexGPT/Алиса | 5 | 3 | 2 | 2 | 5 | 5 | 22 |
| ChatGPT | 4 | 5 | 5 | 5 | 1 | 1 | 21 |
| Claude | 4 | 5 | 4 | 5 | 1 | 1 | 20 |
| DeepSeek | 3 | 3 | 3 | 4 | 3 | 1 | 17 |
Если смотреть только на сумму, победитель один, и это GigaChat. Если читать таблицу целиком, картина честнее. У победителя нет столбца, где он хуже всех, кроме кода. У ChatGPT и Claude нет столбца, где они не в топе, кроме доступа и хранения данных. Рейтинг с одной цифрой прячет этот компромисс. Рейтинг по критериям его показывает.
Бесплатный ИИ-ассистент: что реально бесплатно, а где ловушка
Бесплатно у всех пяти одно и то же: чат с лимитом. YandexGPT бесплатен внутри продуктов Яндекса, GigaChat даёт разработчику бесплатный лимит токенов, DeepSeek бесплатен в вебе и в приложении. У ChatGPT и Claude тоже есть бесплатный чат-режим. Чтобы проверить гипотезу или разово решить задачу, бесплатного тарифа почти всегда хватает.
Дальше начинаются три ловушки, одинаковые для всех пяти.
Первая — лимит. Бесплатный тариф считает запросы или токены, и на реальном потоке упирается в потолок за несколько дней. Вторая — данные. Бесплатные тарифы часто разрешают использовать переписку, чтобы дальше обучать модель: для черновика письма это не страшно, для документа с данными клиента уже риск. Третья — стабильность. Бесплатный тариф обычно работает на облегчённой версии модели, без гарантии скорости и без поддержки.
Бесплатный ИИ-ассистент хорошо решает одну задачу: проверить, годится ли модель для вашего вопроса, прежде чем платить. Как только вопрос превращается в процесс, который повторяется каждый день, платите за тариф, а не ищите бесплатную замену навсегда.
Команде из нескольких человек бесплатный тариф обычно узок вдвойне. Лимит запросов на аккаунт делят все сотрудники сразу, а не каждый по отдельности, поэтому команда из пяти человек упирается в потолок быстрее, чем один пользователь. Разработчики моделей продают отдельные тарифы для команд именно поэтому: там лимит считают на всю группу, а не эмулируют его через пять личных бесплатных аккаунтов.
Какой ассистент лучше для вашей задачи
Таблица баллов не называет единого лучшего ассистента, и это не баг методики, а её смысл. Ниже вывод по задачам, а не по общему месту в рейтинге.
| Задача | Кто лучше по баллам | Почему |
|---|---|---|
| Деловая переписка и документы на русском | GigaChat, YandexGPT | Максимум по деловому русскому и документам, данные в РФ |
| Код и сложная аналитика | ChatGPT, Claude | Максимум по коду и таблицам, доступ — отдельный вопрос |
| Большой объём типовых недорогих задач | DeepSeek | Ниже по качеству, но заметно дешевле на объёме |
| Работа с персональными данными клиентов | GigaChat, YandexGPT | Единственные два с максимумом по 152-ФЗ |
| Разовая проверка гипотезы без бюджета | Любой из пяти в бесплатном тарифе | Лимит и стабильность решают позже, не на старте |
Матрицу задач и семейств моделей я уже разбирал подробнее в статье Нейросети для бизнеса, здесь только вывод, который применим к рейтингу выше: универсально лучшего ассистента нет и не будет. Есть ассистент, который выигрывает там, где это важно именно для вашей задачи.
Два частых бизнес-вопроса не укладываются в таблицу выше напрямую. Поддержка клиентов по базе знаний опирается на те же критерии, что и ответ клиенту и доступ, поэтому логика та же: берите GigaChat или YandexGPT, если важно, где хранятся данные, и универсальную модель, если диалог сложный и многошаговый. Перевод и локализация маркетинговых текстов ближе к ChatGPT и Claude: по моим наблюдениям они увереннее держат нюанс и идиому сразу на нескольких языках. Эту задачу я в шесть критериев теста не включал, и здесь это отдельное впечатление, а не балл.
Рейтинг устаревает быстрее, чем кажется
Этот рейтинг — снимок на дату публикации, а не разовая истина. Разработчики моделей обновляют версии по несколько раз в год, а тарифы и условия доступа меняются ещё чаще. Балл, который я поставил ChatGPT или GigaChat сегодня, через полгода может сдвинуться в любую сторону: одна модель подтянет код, другая упростит доступ из России без иностранной карты.
Практический вывод простой. Прежде чем закладывать выбор ассистента в процесс на годы вперёд, прогоните свои реальные сценарии заново, а не полагайтесь на чужой рейтинг многолетней давности, включая этот. Методику из этой статьи я потому и расписал подробно: чтобы вы могли повторить её на своих задачах и актуальных версиях моделей, а не поверить мне на слово.
Кейс: как я выбирал ассистента для бота квалификации лидов
До теста мой агент квалификации на сайте отвечал на топовой универсальной модели. Диалог получался качественным, но цена диалога росла вместе с потоком обращений: чем больше людей писали боту по вечерам и выходным, тем заметнее счёт за токены к концу месяца. Я прогнал те же диалоги через методику из этой статьи: смотрел на деловой русский, на доступ, на цену токена.
На этой конкретной задаче, коротком диалоге из 3-5 вопросов по заранее заданному сценарию, топовая модель и DeepSeek отвечали почти неразличимо. Клиент на сайте не замечал, какая модель ему отвечает.
Когда я переключился на DeepSeek, диалог стал стоить, по моей оценке, примерно в 5-6 раз дешевле. Сам диалог не изменился: агент спрашивает про услугу, бюджет и срочность и передаёт менеджеру готовый профиль лида вместо сырой переписки.
Пример из нашей практики: агент с квалификацией Digital Broker отвечает посетителю меньше чем за 10 секунд и доводит диалог до готового профиля за 3-5 вопросов. Реализация под свою воронку продаж от 19 900 ₽ разово, версия под ключ с пакетом документов по 152-ФЗ от 39 900 ₽ разово плюс абонентка. Подробности: nodalio.tech/digital-broker.html.
Вывод из этого кейса шире одного бота. Дорогая модель окупается, когда диалог не предсказать заранее и когда ассистенту приходится рассуждать, а не следовать сценарию. Короткий сценарный диалог такого рассуждения не требует: качество дорогой и дешёвой модели здесь почти не отличается, а цена — отличается заметно. Раз в несколько месяцев я прогоняю тот же набор диалогов заново: модели обновляются, и выбор, который был верным весной, летом может устареть.
Читайте также: Сколько стоит внедрение ИИ в бизнес и Чат-бот для сайта: сколько стоит и когда окупается
Что не покажет ни один рейтинг: ассистент против агента
Рейтинг ассистентов сравнивает чат-окно с чат-окном. Ни один пункт методики не проверяет то, что бизнесу часто важнее качества ответа: доходит ли диалог до результата без ручной переноски между окнами.
Ассистент отвечает, и на этом его работа заканчивается. Агент поверх той же модели сам ведёт диалог к результату: спрашивает уточняющие вопросы, сверяется с CRM или 1С, доводит заявку до готового профиля. Прежде чем выбирать победителя из таблицы под свою задачу, сначала решите вопрос проще: вам нужен ответ в чате или результат в системе.
На практике модель из этого рейтинга почти всегда работает внутри агента как один из узлов, а не сама по себе. Агент квалификации из кейса выше не заменяет DeepSeek, он его использует: спрашивает у модели, что ответить, а дальше сам решает, куда передать результат и когда закончить диалог. Победитель рейтинга ассистентов редко становится победителем при выборе модели под конкретного агента: там побеждает связка, которая закрывает нужный критерий дешевле всех остальных, а не самый высокий общий балл. Подробнее о том, чем агент отличается от ассистента и чат-бота: ИИ-агенты для бизнеса.
Частые вопросы
Какой ИИ-ассистент лучший для бизнеса?
Универсально лучшего нет, есть лучший под конкретный критерий. В моём тесте по сумме баллов победил GigaChat, 24 из 30: он выигрывает за счёт документов и доступа из России, но код не его сильная сторона. Для кода и сложной аналитики выше баллы у ChatGPT и Claude, для деловой переписки на русском — у YandexGPT. Таблица баллов по каждому критерию выше в статье помогает выбрать под свою задачу, а не по общей репутации модели.
Какой ИИ-ассистент бесплатный?
Бесплатный лимит есть у всех пяти: YandexGPT и GigaChat — в продуктах для теста, DeepSeek — в вебе, ChatGPT и Claude — в базовом чате. Этого хватает, чтобы проверить, решает ли ассистент нужную задачу. Для процесса, который повторяется каждый день, лимита обычно не хватает: он ограничивает число запросов и часто разрешает использовать переписку, чтобы дообучать модель.
Можно ли использовать ChatGPT и Claude в России легально?
Технически да, через иностранный способ оплаты или посредника, но условия доступа меняются, и их стоит перепроверять перед тем как строить на них процесс. Отдельный вопрос — где хранить данные. Данные при работе через их API уходят на серверы за пределами России, а персональные данные граждан РФ по 152-ФЗ обязаны храниться внутри страны. Для обезличенных задач это не проблема, для данных клиента — уже стоп-сигнал.
Чем ИИ-ассистент отличается от ИИ-агента?
Ассистент отвечает на вопрос в чате: текстом, разбором документа, черновиком письма. Агент сам ведёт диалог к результату: задаёт уточняющие вопросы, сверяется с CRM или 1С, передаёт готовый профиль дальше без ручной переноски. Ассистент из этого рейтинга может работать внутри агента как модель, но рейтинг сравнивает именно чат-окна, а не законченные системы.
Какой ассистент лучше работает с документами на русском языке?
По моим баллам — GigaChat: у него максимум за документы, деловой документооборот — его прямая специализация. ChatGPT и Claude на балл ниже, но увереннее разбирают сложный документ, если нужно сопоставить несколько пунктов подряд, а не выжать один короткий текст.
Стоит ли выбирать ассистента только по сумме баллов?
Нет, сумма — только отправная точка. Если ваша задача попадает в один-два критерия из шести, смотрите баллы именно по ним, а не на итог. GigaChat выигрывает по сумме, но для команды, где основная нагрузка — код и аналитика, впереди ChatGPT и Claude, а итоговая сумма GigaChat здесь почти ничего не решает.
Разберём, что из статьи применимо у вас.
Бесплатный аудит процессов, 30 минут