Выбирать ИИ по списку «лучших нейросетей» — плохая идея. Это как нанимать человека по аватарке. Один сервис хорошо разбирает файлы, другой удобен в редакторе кода, третий помогает быстро найти визуальную идею. Универсального победителя нет.
Полезный ИИ экономит время на вашей повторяющейся работе. Бесполезный создаёт ещё один круг проверки. Поэтому не начинайте с тарифа, красивого демо и громких обещаний. Возьмите реальную задачу: отчёт, бриф, баг или макет. Затем дайте её двум-трём инструментам.
Сначала зафиксируйте критерии
Качество результата и удобство подключения — разные вещи. Русский интерфейс, оплата в рублях, локальный API и привычная документация могут быть важны команде. Но они не доказывают, что модель лучше пишет, считает или программирует.
Сравнивайте актуальные версии на одинаковых файлах и с одинаковой инструкцией. Отключите память и личные настройки, если сервис это позволяет. Запишите дату, тариф, время ответа и число ручных правок.
Оценивайте результат по шести пунктам:
- точность и соблюдение задачи;
- работа с файлами, длинными материалами и правками;
- ошибки, выдуманные факты и лишние действия;
- время до результата, который можно принять;
- безопасность данных и права на результат;
- цена, лимиты, доступ и интеграции.
Не ставьте оценку за уверенный тон. Ставьте её за готовый результат. Если текст нужно переписать, формулы пересчитать, а код долго чинить на ревью, экономии нет.
Тексты, документы и исследования
Для текстов не стоит объявлять лидера. В рабочих материалах нет свежего независимого теста, где ChatGPT, Claude, Gemini, Kimi, GigaChat и другие модели решали одинаковые русскоязычные редакторские задачи. Поэтому выбирайте не «лучшую модель», а кандидатов для своего теста.
ChatGPT, Claude Opus 5 и Gemini 3.1 Pro подойдут для проверки на больших ТЗ, документах и нескольких источниках. У Gemini 3.1 Pro сохраняется статус preview, поэтому его поведение может меняться быстрее. Kimi тоже можно добавить в пилот, если сервис доступен вашему процессу, но в приложенных материалах нет сопоставимых данных о его качестве на русском.
Проверьте не только первый абзац. Дайте модели PDF, расшифровку интервью и противоречивые данные. Посмотрите, сохранила ли она смысл, показала ли расхождения и не добавила ли факты от себя.
Можно скопироватьНиже — материалы для заметки.
Подготовь текст на 1 500–1 800 знаков.
Требования:
— используй только факты из приложенных материалов;
— после каждого важного утверждения укажи название файла;
— если данные расходятся, покажи расхождение;
— не добавляй фактов от себя;
— сначала дай план из пяти пунктов, затем готовый текст.
[вставьте одинаковый набор файлов или текста]Выдуманный факт опаснее неровной формулировки. Стиль можно поправить быстро. Ошибка в письме клиенту или публикации может стоить заметно дороже.
Таблицы: выбирайте среду, а не только чат
Для таблиц важнее место, где уже лежат данные. Если команда работает в Google Sheets, начните с Gemini в Sheets. Если компания живёт в Excel и Microsoft 365, сравните Copilot в Excel с другими вариантами. ChatGPT полезно проверить для разового анализа файлов и работы прямо в Excel или Google Sheets.
ChatGPT умеет создавать и менять многостраничные таблицы, но формулы, ссылки и изменённые ячейки нужно проверять до отправки файла коллегам. Ограничения и порядок работы собраны в справке по ChatGPT для Excel и Google Sheets.

Не тестируйте ИИ на идеальной демо-таблице. Возьмите файл с дублями, пустыми датами, возвратами, разными валютами и странными названиями столбцов. Именно там видно, помогает инструмент или просто красиво пересказывает данные.
Можно скопироватьПроанализируй приложенный файл продаж.
1. Найди три аномалии и покажи строки, на которых основан вывод.
2. Рассчитай выручку, валовую маржу и изменение к прошлому месяцу.
3. Создай отдельный лист «Проверка» с формулами.
4. Не меняй исходный лист.
5. В конце перечисли изменённые ячейки и все допущения.Проверьте формулы руками. Хороший файл должен быть понятен коллеге без переписки с ИИ. Если расчёт нельзя восстановить, он ещё не готов.
Код: смотрите на тесты и дифф
В коде вредно выбирать «лучшую модель вообще». Для сложной разработки разумно тестировать Claude Opus 5, GPT-5.6 и Gemini 3.1 Pro на одном репозитории. Оценивайте не объяснение, а pull request: проходят ли тесты, не сломан ли соседний сценарий и сколько замечаний остаётся после ревью.
Claude Code, Codex и Cursor — не одно и то же, что модели. Это среды и агенты, которые читают проект, меняют несколько файлов и могут запускать команды. Cursor поддерживает разные модели, поэтому его стоит оценивать отдельно: иногда удобство среды важнее небольшой разницы в ответах.
Можно скопироватьИзучи репозиторий и сначала составь план.
Задача: [опишите одну небольшую реальную задачу].
Ограничения:
— не меняй публичный API;
— не добавляй зависимости;
— внеси минимальные изменения;
— запусти существующие тесты;
— добавь тест на исправленный сценарий;
— в финале покажи список файлов, дифф и команды проверки.Не давайте агенту рабочие ключи, пароли и доступ к продакшену. Успех на коротком задании не гарантирует надёжность в длинной цепочке действий. Подход METR полезен именно этим: он оценивает выполнение задач разной длительности, а не рисует общий рейтинг моделей.
Дизайн: сначала Nano Banana, затем специальные сценарии
Для генерации и точного редактирования изображений первым кандидатом стоит проверить Nano Banana 2. По официальной документации модель создаёт изображения до 4K, надёжнее выводит текст, работает с несколькими референсами и сохраняет согласованность объектов. Nano Banana Pro предназначена для сложных макетов, локализации и контроля фирменного стиля. Это подтверждённые возможности, а не доказательство победы в любом творческом брифе.
Midjourney добавьте, когда важнее быстро найти выразительную концепцию. Adobe Firefly удобен командам, которые продолжают работу в Adobe и отдельно проверяют условия коммерческого использования. Шедеврум оставьте как простую локальную альтернативу: у него есть генерация по русскому запросу и модели для надписей, но перед коммерческой работой нужно проверить правила использования результата.

Покажите варианты коллегам без названий сервисов. Оцените попадание в бриф, композицию, читаемость текста, артефакты и удобство правок. Красивая картинка не всегда становится рабочим макетом.
Можно скопироватьСделай вертикальный рекламный постер 1080×1350.
Продукт: [ваш продукт].
Аудитория: [ваша аудитория].
Стиль: [3–5 конкретных признаков].
Обязательные объекты: [список].
Запрещено: логотипы чужих брендов, мелкий нечитаемый текст, водяные знаки.
Сделай 4 разные композиции.Локальные сервисы и API
Алиса AI удобна для быстрого поиска и разбора русскоязычных DOC, DOCX, PDF и TXT внутри сервисов Яндекса. GigaChat и Yandex AI Studio стоит рассматривать, когда нужен локальный API-контур, привычная оплата или интеграция в существующую инфраструктуру.
Это преимущества доступа и внедрения, а не доказательство более сильной модели. Алису AI и GigaChat проверяйте на тех же файлах и запросах, что Claude, ChatGPT и Kimi. Так локальное удобство останется отдельным критерием и не исказит оценку качества.
Начните с одной еженедельной задачи и двух кандидатов. Дайте им одинаковые материалы. Посчитайте время, ошибки и число правок. К концу дня у вас будет не чужой рейтинг, а рабочий выбор для своей команды.




