
Здравствуйте! Меня зовут Анатолий Чупин. Я являюсь редактором сайта Postium, исследователем в области ИИ и автором Telegram-канала «Промты — и точка».
Это #Тестиум — рубрика, где я провожу сравнение ИИ-моделей на реальных задачах из моей профессиональной деятельности. Никаких абстрактных бенчмарков: я предоставляю моделям идентичные задания, многократно повторяю каждый тест и анализирую не только наилучший ответ, но и стабильность результатов.
Сегодня мы выясним, кто лучше справляется с текстами — ChatGPT (GPT-5.6 Sol) или DeepSeek (V4). Я подготовил пять задач, с которыми регулярно сталкиваюсь: редактирование машинного текста, написание постов и разъяснительных материалов, преобразование пресс-релиза в новость и работа с фактами.
Как проходило тестирование?
В данном выпуске сравниваются две модели:
— ChatGPT — GPT-5.6 Sol;
— DeepSeek — DeepSeek V4.
Обе модели получили одинаковые задания и исходные данные. В ChatGPT каждый тест проходил в временном чате, чтобы модель не использовала память и контекст. В DeepSeek аналогичного режима нет, поэтому в каждом новом чате я запрещал использовать информацию из предыдущих диалогов.
1. Одинаковые задания. ChatGPT и DeepSeek получили идентичный промт и одинаковые исходные данные. В этом тесте я использовал пять задач из своей практики работы с текстом.
2. По три попытки. Каждая модель выполняла каждую задачу три раза в отдельных запусках. В итоге на один тест получалось шесть ответов:
— 3 от ChatGPT;
— 3 от DeepSeek.
Таким образом, я проверял не только наилучший результат, но и стабильность модели. Один удачный ответ ещё не демонстрирует, насколько хорошо ИИ справляется с задачей на постоянной основе.
3. Ответы обезличивались. Перед оценкой я удалял названия моделей и перемешивал все шесть вариантов.
ИИ-судьи не знали, какой ответ принадлежит ChatGPT, какой — DeepSeek и к какому из трёх запусков относится конкретный текст.
4. Три независимых ИИ-судьи. Каждый ответ оценивался независимо тремя различными ИИ-моделями (Claude, Gemini и Grok) по заранее установленным критериям и единой шкале.
Таким образом, один вариант получал сразу три оценки. После этого результаты усреднялись.
5. Ручная проверка. После оценки ИИ я сам проверял результаты.
Если судья пропустил фактическую ошибку, нарушение задания или, наоборот, необоснованно снизил балл, я корректировал оценку вручную и отдельно указывал причину.
6. Что сравнивалось. В этом #Тестиуме я проверил пять типов задач:
- Редакция машинного текста.
- Короткий текст с жёсткими ограничениями.
- Разъяснение сложной темы простым языком.
- Переработка пресс-релиза в новость для Telegram.
- Работа с фактами и сомнительными исходными данными.
7. Как определялся победитель. По каждой задаче я оценивал средний результат трёх попыток, качество отдельных ответов и разброс между ними.
Кто лучше пишет и редактирует текст — ChatGPT или DeepSeek?
Результаты Тестиума
По итогам пяти заданий ChatGPT набрал 7,7/10, DeepSeek — 7,3/10.

Если по отдельному тесту я вручную корректировал оценку после проверки ответов, в итоговый расчёт шла именно скорректированная оценка.
| Задание | ChatGPT | DeepSeek | Победитель |
| 1. Редакция машинного текста | 9,8 | 8,3 | ChatGPT |
| 2. Короткий пост о пользе кофе | 8,6 | 6,8 | ChatGPT |
| 3. Объяснение инфляции простым языком | 8,5 | 8,1 | ChatGPT |
| 4. Новость для Telegram из пресс-релиза | 6,6 | 8,3 | DeepSeek |
| 5. Сценарий с проверкой сомнительных данных | 5,0 | 5,0 | Ничья |
| Итог | 7,7/10 | 7,3/10 | ChatGPT |
По заданиям счёт получился 3:1 в пользу ChatGPT при одной ничьей.
Разница незначительная — всего 0,4 балла. ChatGPT выигрывал за счёт точности, соблюдения инструкций и стабильности, в то время как DeepSeek проявлял себя лучше в форме и подаче. Далее разберём каждое тестирование отдельно.
Тест №1. Убрать машинный стиль из текста
Первое задание заключалось в редактировании и вычитке текста. Я предоставил нейронкам намеренно плохо написанный абзац с характерными ИИ-паттернами:
Сегодня искусственный интеллект перестаёт быть просто технологическим инструментом и становится полноценной частью повседневной жизни. Для пользователей это означает следующее: теперь задачи во многих сценариях можно решать быстрее, эффективнее и удобнее. Речь идёт не только о написании текстов, но и о работе с информацией, изображениями и другими форматами контента. Это не про хайп, это про эффективность. На практике же всё зависит от того, насколько правильно пользователь формулирует запрос и выбирает подходящий нейросетевой инструмент. Таким образом, ИИ открывает новые возможности как для обычных пользователей, так и для бизнеса.
Необходимо было выявить конкретные проблемные места, объяснить, что с ними не так, предложить точечные замены и в конечном итоге показать исправленный вариант. При этом нельзя было просто переписывать весь текст заново.
— ChatGPT проявил стабильность. Во всех трёх попытках модель хорошо находила шаблонные связи, кальки, избыточные противопоставления и абстрактные формулировки. При этом она корректировала текст выборочно, не меняя его смысл и структуру.
— DeepSeek также успешно определял машинный стиль, но результаты сильнее зависели от конкретного запуска. В одном ответе модель предлагала удачные и естественные замены, в другом часть штампов оставалась, а некоторые новые формулировки звучали шаблонно или спорно.

Итоговый результат: GPT-5.6 Sol — 9,8/10, DeepSeek V4 — 8,3/10.
Тест №2. Написать короткий пост о пользе кофе
Во втором задании требовалось написать короткий пост о пользе кофе. Я намеренно задал строгие ограничения по объёму и содержанию: назвать несколько конкретных эффектов, обязательно упомянуть, что результат зависит от количества кофе и индивидуальной чувствительности к кофеину, избегать категоричных медицинских утверждений и не использовать шаблонные конструкции ИИ.
— ChatGPT лучше соблюдал ограничения. Все три ответа укладывались в заданный формат, содержали необходимые оговорки и утверждения о пользе кофе. Однако в двух вариантах модель местами использовала слишком осторожные и расплывчатые формулировки, такие как «поддержка нормальной работы некоторых систем организма».
— DeepSeek предоставлял более конкретные и живые ответы, но хуже следовал инструкции. Все три ответа превышали установленные ограничения по объёму. В первом варианте появились чрезмерно уверенные медицинские утверждения, а второй и третий были заметно лучше по содержанию, но всё равно превышали заданный лимит.
Здесь я скорректировал оценки судей. У ChatGPT снял 0,5 балла за излишнюю осторожность и общие формулировки. DeepSeek, наоборот, получил повышение оценки: особенно хорошо выглядел третий вариант, который, несмотря на превышение объёма, хорошо раскрыл тему и самостоятельно выстроил текст из трёх абзацев.

Итоговый результат: GPT-5.6 Sol — 8,6/10, DeepSeek V4 — 6,8/10.
Тест №3. Объяснить инфляцию простым языком
Следующая задача — подготовить короткий разъяснительный материал об инфляции для широкой аудитории. Нужно было простыми словами объяснить, что происходит с деньгами и ценами, привести бытовой пример и показать, как инфляция затрагивает обычного человека.
— ChatGPT лучше сохранял точность и логику объяснения. Во всех трёх попытках модель корректно описывала инфляцию как увеличение общего уровня цен и связывала её с падением покупательной способности денег. Хорошо работали и конкретные примеры: например, рост стоимости продуктовой корзины с 4000 до 4400 рублей связывался с тем, где семье нужно будет искать дополнительные 400 рублей. Слабым местом являлись заголовки. Формулировки вроде «Почему деньги со временем покупают меньше» звучали неестественно.
— DeepSeek писал менее стабильно, но лучше работал с заголовками и образностью. Например, «Почему деньги тают: просто о сложном» смотрелся сильнее, чем варианты ChatGPT. Однако попытки сделать объяснение ярче иногда мешали точности, а в одном из ответов причины инфляции были слишком сильно сведены к росту количества денег относительно товаров.
Здесь я также скорректировал итоговые оценки. ChatGPT снизил на 0,5 балла за неудачные заголовки. DeepSeek, наоборот, добавил 0,5 балла: его исходная оценка была слишком жёсткой с учётом того, что два из трёх текстов вполне подходили, а заголовки были заметно сильнее.

Итоговый результат: GPT-5.6 Sol — 8,5/10, DeepSeek V4 — 8,1/10.
Тест №4. Превратить пресс-релиз в новость
В четвёртом задании я предоставил моделям факты из официального анонса Google о новых интеграциях Gemini. Нужно было преобразовать их в короткую новость для Telegram объёмом 400–600 знаков: сделать конкретный заголовок, сразу объяснить суть обновления, выбрать 2–3 понятных примера вместо длинного списка сервисов и показать, что именно меняется для пользователя.
Отдельно запретил использовать язык пресс-релизов и шаблонные формулировки вроде «открывает новые возможности» и «единое пространство».
— DeepSeek оказался заметно сильнее в этом задании. Лучший вариант получил максимальные оценки от всех судей. Особенно удачным получился заголовок: «Gemini теперь сам бронирует столики и записывает к врачу». Модель не пересказывала формулировку Google об интеграциях, а сразу демонстрировала изменения через понятные действия. Однако качество между тремя попытками всё же различалось.
— ChatGPT писал понятно и достаточно компактно, но чаще придерживался структуры пресс-релиза. Заголовки были более абстрактными, а в тексте встречались типичные конструкции вроде «Для пользователя это означает» и «не только…, но и…». Самый слабый вариант дополнительно перегрузил новость перечислением возможностей вместо отбора нескольких сильных примеров.
Здесь я не стал менять оценки судей: разница между моделями хорошо совпала с моей редакторской оценкой.

Итоговый результат: GPT-5.6 Sol — 6,6/10, DeepSeek V4 — 8,3/10.
Тест №5. Написать сценарий и проверить факты
В последнем задании я намеренно создал ловушку. Моделям нужно было написать короткий сценарий для Reels о том, почему зумеры меняют своё отношение к фитнесу. Я предоставил готовые данные, но часть из них была ненадёжной.
Причём ловушки были различными:
- Первый тезис был реальным: в отчёте The Gym Group за 2025 год действительно указано, что 73% опрошенных представителей Gen Z тренируются минимум два раза в неделю.
- Второй тезис был полностью вымышленным: исследования Oxford Youth Research Centre за 2026 год с цифрой 35% не существует.
- Третий был свободным истолкованием реального исследования. Само исследование существует и касается барьеров для занятий йогой, но указанная в задании цифра была придумана.
При этом в задании я отдельно указал: перед использованием данных нужно проверить их достоверность и не выдавать неподтверждённые утверждения за факт.
То есть модель должна была выполнить сразу две задачи: понять, каким данным можно доверять, а какие следует отбросить или оговорить, и при этом выдать полноценный сценарий Reels с хуком, фактами, объяснением и кратким выводом.
— ChatGPT значительно лучше справился с фактчекингом. Во всех трёх попытках модель заметила неподтверждённую цифру 35% и не стала выдавать её за установленный факт. Также ChatGPT осторожнее отнёсся к выводу о том, что зумеры якобы массово переходят от йоги к интенсивным тренировкам. Однако возникла другая проблема: вместо сценария для Reels модель просто перечислила факты с оговорками о том, что правда, а что нет.
— DeepSeek сделал противоположное. Он подготовил сценарии: появились кадры, тайминги, хуки, текст для озвучивания и визуальные идеи. Но модель включила в них вымышленную цифру 35%, приняла натянутый вывод за подтверждённый факт и местами добавила сведения, которых не было в исходных данных.
ИИ-судьи высоко оценили ChatGPT за фактологическую аккуратность и почти аннулировали оценку DeepSeek за галлюцинации. Однако для меня здесь важнее другое: ни одна модель не выполнила задание до конца.
ChatGPT проверил факты, но не написал сценарий. DeepSeek создал сценарий, но использовал в нём вымышленные и неподтверждённые данные. То есть обе модели справились лишь с половиной задания. Поэтому здесь я ставлю ничью и по 5 баллов каждой.

Итоговый результат: GPT-5.6 Sol — 5/10, DeepSeek V4 — 5/10.
Что в итоге?
Итоговый счёт по заданиям — 3:1 в пользу ChatGPT при одной ничьей. При этом по среднему баллу разница минимальна: ChatGPT — 7,7/10, DeepSeek — 7,3/10.
Тем не менее, тесты предоставляют более ценную картину, чем этот счёт.
Первое — DeepSeek не потерпел разгромного поражения от ChatGPT, и это меня удивило. Представьте, если бы у DeepSeek были такие же возможности в интерфейсе, как у ChatGPT: проекты, боты, агенты и другие инструменты для постоянной работы с контекстом. В этом случае, по моему мнению, он бы сегодня точно не уступал ChatGPT.
Второе — ChatGPT лучше придерживается инструкций. Если работаете с GPT, давайте ему больше конкретики: контекст, требования, ограничения, примеры. Чем чётче ТЗ, тем качественнее результат.
Третье — DeepSeek находит интересные подходы при переборе генераций. Он может предложить неожиданный заголовок, подачу или формулировку, до которой GPT просто не додумается. Поэтому его использование в работе определённо стоит рассмотреть.
При использовании или упоминании результатов данного исследования ссылка на первоисточник обязательна.


