ChatGPT против Claude: сравниваем топовые нейронки на 6 задачах

Пост опубликован в блогах iXBT.com, его автор не имеет отношения к редакции iXBT.com
| Обзор | ИИ, сервисы и приложения

ChatGPT и Claude — это самые популярные и мощные инструменты на рынке ИИ сейчас. Обе нейронки умеют писать тексты, считать таблицы и собирать файлы. Мне захотелось сравнить и понять, какая же из них все-таки лучше. Но на простых задачах этого не поймешь — они решат их быстро и без ошибок.

Поэтому я подготовился и собрал 6 задач: написать текст, разобраться в грязной таблице, починить чужой код, собрать калькулятор, ответить по большому документу и сделать презентацию для инвестора. В три задачи я заранее подложил ловушки, но моделям про них, само собой, ничего не сказал.

Тестировал ChatGPT на модели с очень высоким усилием мышления и Claude Fable 5.1 в режиме Extra. Каждую задачу запускал в новом чате, память и персонализацию я отключал, чтобы нейронки не подстраивались под меня, а работали с голым заданием.

Каждую задачу оценивал по 10-балльной шкале. Баллы складывались из четырёх пунктов: выполнены ли условия задания, сходятся ли цифры с правильным ответом, поймана ли ловушка и удобно ли пользоваться тем, что нейронка выдала.

Пишем текст по заданию

Первым делом я попросил обе нейронки написать статью про то, почему домашний Wi-Fi тормозит вечером.

Вообще, у меня есть свой набор правил и примеров, по которому я обычно гоняю нейронку в несколько заходов, но здесь я решил пойти максимально простым путем и уместить всё в один запрос.

В задании я написал так:

пишем для обычных людей, а не для сетевых инженеров; тон спокойный, без рекламы, обращение на «вы» объём 4000-5000 знаков; подзаголовков не больше четырёх; у каждого сильного совета называть границы — кому и когда он не поможет; цифры не выдумывать, а если приводишь, говорить, откуда она.

Отдельным блоком перечислил машинные штампы, которых быть не должно: противопоставления «это не X, это Y», рубленые фразы без подлежащего, ритм «тормозит — перезагрузите», перечисления по три с одинаковым ритмом и канцелярит в духе «данный инструмент является решением».

ChatGPT справился за 1 минуту и выдал текст отдельным документом прямо в чате. Claude ответил примерно за то же время и тоже выдал отдельный документ.

Формально оба задание выполнили. Я прогнал тексты своим скриптом, который ищет те самые штампы из списка: запрещённых оборотов ноль, перечислений по три ноль, противопоставлений ноль. По объёму тоже попали: у ChatGPT получилось 4833 знака, у Claude — 4974.

ChatGPT выдал текст отдельным документом и сам сослался на справки Google и Apple
ChatGPT выдал текст отдельным документом и сам сослался на справки Google и Apple
Автор: Михаил Шумовский

ChatGPT, когда я запретил выдумывать цифры, сам полез в поиск и расставил ссылки на справки Google и Apple.

Как ту же тему раскрыл Claude
Как ту же тему раскрыл Claude
Автор: Михаил Шумовский

Claude пошёл другим путём и вытащил конкретику из стандартов связи. Объяснил, что в диапазоне 2,4 ГГц всего три канала, которые не мешают друг другу, поэтому вечером там тесно. Привёл в пример скорости: телефон на 2,4 ГГц вытянет максимум 144 Мбит/с, а на 5 ГГц — 867. И предупредил про дешёвый усилитель в розетку: тот повторяет каждый пакет на том же канале, скорость за ним падает примерно вдвое, а эфир забивается сильнее.

По фактуре у Claude получился более подробный и полезный текст. Но вот читать мне приятнее ответ ChatGPT: он понятнее донес саму мысль и лучше провел меня как читателя по материалу.

Сравните сами. ChatGPT: «Дома одновременно включаются телевизор, ноутбуки, телефоны, приставка, облачные копии, а соседские роутеры занимают тот же радиоэфир». Claude про то же: «Соседи вернулись домой и включили видео, а их сети делят с вашей одни частоты». Второй вариант точнее, но дальше у него в каждом абзаце идут гигагерцы и мегабиты — местами получился справочник, а не статья.

Но даже с учетом условно выполненного задания высокие баллы я не поставлю никому — ни один из текстов мне не нравится по стилистике. А зная, как хорошо они могут писать, ставить им выше 8 баллов будет кощунством. Поэтому ChatGPT я дам 6, Claude — 5.

Проверяем таблицу на 2900 строк

Дальше я придумал выгрузку заказов интернет-магазина за год и от души её испортил:

  • добавил 45 полных дублей;
  • 554 даты текстом в трёх форматах;
  • 181 строку с разнобоем в городах («Мск», «г. Москва», «Екб»);
  • 30 цен текстом вида «6 490 ₽»
  • 22 пустые суммы и 14 сумм с минусом у выполненных заказов.

Плюс добавил 200 отменённых заказов, которые в выручку идти не должны.

Кусок исходной таблицы: дубль, минус, пустая сумма, цена текстом и сокращённые города
Кусок исходной таблицы: дубль, минус, пустая сумма, цена текстом и сокращённые города
Автор: Михаил Шумовский

А ещё я добавил главную ловушку. Дубли и дорогие отменённые заказы я собрал в одном месяце — в ноябре. Смысл такой: если нейронка посчитает выручку как есть, то ноябрь наберёт 3,71 млн рублей и выйдет на первое место по доходам. Но на самом деле 222 тысячи рублей там набежит от дублей, а еще почти 1,5 млн — это отменённые заказы, деньги по которым магазин не получил. Уберите их, почините минусы и пустые суммы — у ноября останется 2,06 млн, и лучшим месяцем станет декабрь с 2,27 млн.

Попросил я простое: найти все проблемные строки и сказать, сколько их, вернуть чистый Excel, посчитать выручку по месяцам только по выполненным заказам, построить график и назвать лучший месяц, худший и категорию-лидера.

ChatGPT думал над задачей 20 минут — это самый долгий ответ за весь тест. Claude потратил примерно столько же.

Таблица найденных проблем с количеством строк от ChatGPT
Таблица найденных проблем с количеством строк от ChatGPT
Автор: Михаил Шумовский

Обе нейронки нашли все шесть видов ошибок и назвали точные количества. Обе не попались на ноябрь. И у обеих выручка по всем двенадцати месяцам сошлась с моим эталоном до рубля: 19 870 310 рублей за год, лучший месяц декабрь, худший февраль, а больше всего денег принесла электроника — 12,07 млн.

Файлы я скачал и открыл. У ChatGPT получилась книга на восемь вкладок. На первой дашборд: крупные плашки с итогами и диаграмма. Дальше чистые заказы, сводки, журнал всех 843 исправлений, удалённые дубли и отдельная вкладка «Проверить суммы» с сомнительными строками.

Дашборд в файле от ChatGPT
Дашборд в файле от ChatGPT
Автор: Михаил Шумовский

Ещё ChatGPT сделал то, чего я не ожидал: написал, что 14 сумм с минусом могут быть не ошибкой знака, а возвратами денег покупателям, и посчитал выручку в двух вариантах — 19 870 310 рублей, если минусы исправить, и 19 689 210, если оставить.

Чистая таблица от Claude
Чистая таблица от Claude
Автор: Михаил Шумовский

У Claude файл получился скромнее, всего четыре вкладки. Зато сводки он собрал формулами: если потом поправить любую строку в данных, итоги пересчитаются сами.

График выручки по месяцам от Claude
График выручки по месяцам от Claude
Автор: Михаил Шумовский

И добавил своё наблюдение: за год ошибки почти гасят друг друга — лишние 355 тысяч от дублей примерно равны 344 тысячам, которые съедают минусы и пустые суммы.

Обе нейронки получают по 10 баллов: задача была самой трудоёмкой из шести, а результат сошёлся до рубля. Но файлы у них получились для разных людей. Книга ChatGPT с журналом правок пригодится тому, кто потом будет отчитываться, откуда взялась каждая цифра. Файл Claude на формулах удобнее тому, кто продолжит работать с этими данными дальше.

Улучшаем код

Здесь надо честно сказать: я не программист и не знал, как правильно подготовить для вас сравнение по коду. Поэтому задачу мы придумывали вместе с Claude. Он предложил сценарий: взять типовую работу, которую в реальности отдают нейросети, — разбор логов сайта. Сам написал для теста рабочий скрипт, сам заложил в него ошибки и не стал перечислять, какие именно.

Чтобы это было честно, задачу обеим нейронкам я отдавал в новом чате с отключённой памятью: ни ChatGPT, ни Claude не видели ни переписки, где задача придумывалась, ни списка заложенных ошибок. А результат я потом проверял не на слово: скачал оба исправленных скрипта, прогнал у себя на компьютере и сверил цифры.

Теперь объясню, что это за задача, потому что без этого дальше будет непонятно.

Любой сайт записывает каждое обращение к себе отдельной строкой: кто зашёл, во сколько, на какую страницу, что ответил сервер и сколько секунд думал. Такой файл называется логом, и в моем тестовом примере в нём набралось 45 тысяч строк. Руками все эти записи не отсмотришь, поэтому их обычно проверяют скриптами.

Наш скрипт считает шесть вещей: сколько было обращений и разных посетителей, пять самых популярных страниц, долю ошибок двух видов (4xx — виноват посетитель или ссылка, 5xx — сломался сервер), скорость ответа и час пик.

Кусок лога с обрезанной строкой и фрагменты кода с ошибками
Кусок лога с обрезанной строкой и фрагменты кода с ошибками
Автор: Михаил Шумовский

Внутри скрипта оказалось 5 ошибок:

  • Скрипт падал на обрезанных строках, а такие есть в любом логе.
  • Разных посетителей искал самым медленным способом: для каждой новой строки перебирал весь список найденных.
  • Ошибки посетителя и поломки сервера сваливал в одну кучу.
  • Одну и ту же страницу с разными хвостами адреса считал разными страницами.
  • Криво считал скорость ответа сайта — брал время случайного запроса вместо честного расчёта.

В цифрах это выглядело так. Долю ошибок скрипт показывал 10,29% вместо правильных 8,64%. Время ответа сайта занижал: 0,307 секунды вместо настоящих 0,453, то есть сайт казался шустрее, чем он есть. В топ популярных страниц у него не попадал каталог, хотя это самая посещаемая страница магазина. А на сам разбор лога он тратил 3,7 секунды — долго для такого файла.

Правильные цифры я, опять же, знал заранее: Claude отдельно посчитал их, и они стали эталоном для проверки.

ChatGPT потратил на задачу 16 минут, Claude — примерно 13. Обе нейронки нашли все пять заложенных ошибок и добавили к ним свои находки.

Разбор ошибок от ChatGPT
Разбор ошибок от ChatGPT
Автор: Михаил Шумовский

ChatGPT нашёл ещё три: падение на пустом файле, ломкий разбор строки по пробелам и отсутствие проверок значений (сложно, согласен). И прицепился к самой формуле скорости: даже если список отсортировать, она ошибается на один элемент, когда 0,95 от числа строк даёт целое число. Такую тонкость в скрипт никто специально не закладывал, ChatGPT докопался до неё сам ;)

Замер скорости до и после у ChatGPT
Замер скорости до и после у ChatGPT
Автор: Михаил Шумовский

Разбор ошибок у Claude
Разбор ошибок у Claude
Автор: Михаил Шумовский

Claude посчитал то, о чём я не просил: если бы скрипт не падал на кривых строках, он всё равно потерял бы 65 нормальных запросов и 17 посетителей. И нашёл похожую подставу: окажись между лишними кавычками число, скрипт молча принял бы его за время ответа и никто бы этого не заметил.

Результат прогона исправленного скрипта у Claude
Результат прогона исправленного скрипта у Claude
Автор: Михаил Шумовский

Дальше я скачал оба скрипта и прогнал их у себя на компьютере. Все цифры в отчёте совпали с эталоном. Разбор всего лога у скрипта Claude занял 0,14 секунды, у скрипта ChatGPT — 0,37. Напомню, сломанная версия тратила на то же самое 3,7 секунды.

Ещё я просил написать тесты — маленькие проверки, которые прогоняют скрипт на известных данных и сверяют результат с правильным ответом. У ChatGPT получилось 55 тестов, и запускались они без установки лишних программ. Я подсунул им вместо исправленного скрипта исходный, сломанный: тесты дружно ругнулись, значит, словили, что должны.

У Claude получилось 35 тестов, но им была нужна отдельная библиотека, и написаны они были под новую версию скрипта — на старом просто не запускались.

В общем, здесь ставлю по 10 баллов обоим участника: все ошибки найдены, скрипты после правок работают, цифры совпали.

Создаем интерактивный калькулятор

Для следующей задачи я решил проверить, как нейронки сделают что-нибудь полезное и интерактивное. Попросил собрать ипотечный калькулятор прямо в чате: со стоимостью квартиры, взносом в рублях или процентах, ставкой, сроком, типом платежа и разовым досрочным погашением, где можно выбрать, что уменьшать — срок или платёж. Плюс график остатка долга и таблица платежей по месяцам.

Claude собрал калькулятор прямо в окне разговора: его можно открыть тут же, ввести свои цифры и сразу получить расчёт.

Калькулятор Claude работает внутри чата
Калькулятор Claude работает внутри чата
Автор: Михаил Шумовский

ChatGPT так не смог и поэтому сделал отдельный файл, который открывается предпросмотром в чате. А подсчеты в нем можно сделать только после скачивания.

Калькулятор ChatGPT: отдельный файл с предпросмотром
Калькулятор ChatGPT: отдельный файл с предпросмотром
Автор: Михаил Шумовский

Правильные ответы я опять посчитал заранее своей таблицей. Условия: квартира 9 млн, взнос 2 млн, ставка 21%, срок 25 лет. По ним платёж выходит 123 176,40 рубля, переплата за все годы — почти 30 млн. Ещё я просил показывать нужный доход, чтобы платёж не съедал больше половины зарплаты. По моим условиям это 246 353 рубля.

Отдельно проверил досрочное погашение миллионом на 24-м месяце. Если сокращать срок, кредит закроется за 134 месяца вместо 300 и сэкономит 19,5 млн процентов. Если тем же миллионом уменьшать платёж — экономия всего 3,87 млн. Разница между двумя вариантами почти в пять раз, и на ней калькуляторы обычно и врут.

Так вот, обе нейронки посчитали всё до рубля: и платёж, и переплату, и нужный доход, и оба варианта досрочного погашения. Ни одного расхождения с моей таблицей.

У Claude сверх задания появились выгрузка таблицы платежей в CSV и пунктирная линия на графике «как было бы без досрочного погашения» — сразу видно, сколько лет вы себе отыграли. У ChatGPT на графике тоже появился пунктир в месте досрочного платежа, а если навести курсор, всплывает подсказка с остатком долга на этот месяц.

Claude я поставлю 10 баллов, ChatGPT — 9. Расчёты одинаковые, но работающий внутри чата калькулятор удобнее, чем файл, который надо открывать отдельно. Лично мне так проще, хотя понимаю, что кому-то отдельный файл как раз нужнее.

Проверяем большой документ на 47 страниц

Дальше я решил проверить, как нейронки читают большие документы. Я собрал PDF с официальным текстом правил дорожного движения в действующей редакции: 47 страниц вместе с перечнем неисправностей.

Задавать решил по три вопроса и требовать к каждому ответу номер пункта и страницу, чтобы можно было проверить.

Первые два вопроса обычные: с какого возраста ребёнка можно везти на переднем сиденье без детского кресла и какая минимальная глубина протектора у летних и зимних шин. Третий вопрос — ловушка: какой штраф за проезд на красный свет. Штрафов в правилах нет, они в другом документе, в КоАП. Нейросеть, которая ответит суммой, выдаст знание из головы за ответ по документу. (я ожидаю, что нейронка скажет, мол, я то знаю и все проверила, но конкретно в этом документу инфы не было)

Ответ ChatGPT с номерами пунктов и страниц
Ответ ChatGPT с номерами пунктов и страниц
Автор: Михаил Шумовский

Ответ Claude
Ответ Claude
Автор: Михаил Шумовский

Ни одна нейронка на уловку не попалась. Обе ответили: с 12 лет, потому что детей от 7 до 11 лет на переднем сиденье возят только в удерживающем устройстве. Обе дали правильные цифры по протектору: больше 1,6 мм для обычных шин и больше 4 мм для зимних на снегу и льду. И обе прямо сказали, что размера штрафа в документе нет.

Номера страниц я проверил по файлу — все до единой верные, у обеих.

ChatGPT ответил компактнее и уложился в 2 минуты. Claude дал чуть больше: добавил пункт про ремень безопасности, упомянул индикаторы износа на шинах и отдельно оговорил, что слова «летние» в документе вообще нет, это общая норма для шин.

Снова по 10 баллов: обе прочитали документ целиком, ничего не выдумали и не постеснялись сказать «в документе этого нет». Для работы с договорами и инструкциями это главное.

Делаем презентацию

На сладенькое я решил оставить самое интересное — создание презентаций.

Я написал заметки владельца кофейни в Казани: выручка по месяцам за год, расходы, план второй точки и смета на открытие. Попросил сделать из них презентацию для инвестора на 8-10 слайдов, посчитать срок окупаемости и показать расчёт, а к каждому слайду добавить заметки для выступающего.

В смету я подложил ошибку. Четыре строки: ремонт, оборудование, мебель и запуск — дают в сумме 4,9 млн рублей, а итогом внизу написано 4,8 млн.

Кусок заметок: строки сметы дают 4,9 млн, а итог написан 4,8 млн
Кусок заметок: строки сметы дают 4,9 млн, а итог написан 4,8 млн
Автор: Михаил Шумовский

ChatGPT собрал презентацию за 7 минут, Claude — примерно за столько же. Оба выдали файл PowerPoint на 10 слайдов, где диаграммы настоящие, а не вставленные картинкой: такой график можно потом поправить прямо в презентации. К каждому слайду обе нейронки написали заметки для выступающего. Цифры выручки на графиках я сверил со своими — все двенадцать значений верные.

Титульный слайд от ChatGPT
Титульный слайд от ChatGPT
Автор: Михаил Шумовский

Слайд с выручкой по месяцам
Слайд с выручкой по месяцам
Автор: Михаил Шумовский

Срок окупаемости обе посчитали правильно и показали расчёт: у ChatGPT вышло 37,8 месяца, у Claude — 38-й месяц, то есть около трёх лет. Мой эталон — 38 месяцев.

Пошаговый расчёт окупаемости у ChatGPT
Пошаговый расчёт окупаемости у ChatGPT
Автор: Михаил Шумовский

А вот со сметой вышло по-разному. ChatGPT расхождение заметил и вынес его прямо в заголовок слайда: «Смета: 4,8 млн ₽ заявлено — 4,9 млн ₽ по строкам». Мало того, он посчитал окупаемость для обеих сумм: 37,8 месяца при 4,8 млн и 38,7 при 4,9 млн.

Claude разницу не увидел. Больше того, он поставил внизу слайда строку «Ремонт и дизайн 2,1 · оборудование 1,9 · мебель 0,5 · запуск и маркетинг 0,4 = 4,8 млн ₽». Точки здесь вместо плюсов, то есть слайд утверждает, что 2,1 + 1,9 + 0,5 + 0,4 равно 4,8. Сложите сами;)

Слайд Claude, где 2,1 + 1,9 + 0,5 + 0,4 почему-то равно 4,8 млн
Слайд Claude, где 2,1 + 1,9 + 0,5 + 0,4 почему-то равно 4,8 млн
Автор: Михаил Шумовский

Справедливости ради, в остальном презентация Claude сильная: пять диаграмм вместо двух и отдельный слайд с тем, что будет со сроком окупаемости, если выручка окажется на 10% ниже плана. И он честно предупредил, что добавил инвестору два обещания, которых в заметках не было: ежемесячную отчётность и доступ к учёту. Написал прямо: если не готовы — уберите.

ChatGPT я поставлю 10 баллов, Claude — 8. Два балла снимаю за смету (хотя дизайн у Claude в 100 раз круче).

Подводим итоги

А итоги ожидаемые:

Задача ChatGPT Claude
Текст по редзаданию 6 5
Грязная таблица 10 10
Чужой код с ошибками 10 10
Калькулятор в чате 9 10
Документ на 47 страниц 10 10
Презентация для инвестора 10 8
Итого 55 53

Разрыв в два балла из 60 — это ничья, если честно. Четыре задачи из шести обе нейронки сделали одинаково: до рубля, до номера страницы, до последней найденной ошибки в коде. Хотя врать не буду — Claude со своей ошибкой в презентации сильно разочаровал. От него я такого никак не ожидал.

Так, а какую нейронку использовать? А любую. Доступ к обоим заблокирован из России. Обе оплатить российскими картами нельзя. Разницы в качестве ответов практически нет. Поэтому и однозначно кого-то посоветовать я не могу;)

Изображение в превью:
Автор: GPT Image
Источник: GPT Image
Автор не входит в состав редакции iXBT.com (подробнее »)
Об авторе
Главный редактор медиа о неросетях. Автор телеграм-канала о нейросетях Миша, давай по новой

6 комментариев

Добавить комментарий

Gilbert_Leps
Ещё бы добавить в такие тесты задания на перевод художественного текста с англ., исп., и итальянского языков на русский.
mikeshu
ох, ну это для меня будет сложно)
Gilbert_Leps
ох, ну это для меня будет сложно)

Ну тогда только с английского.
Gilbert_Leps
А вообще, самая информированная ИИ, это гугловская, как-то я попросил её найти один русский клип далеко не самой популярной певицы по весьма смутному описанию не зная ни имени исполнительницы ни названия. Примерно по такому запросу: «там пелось про черёмуху, и про то что он женат и любит своих дочерей, но она всё равно его любит и уведёт. Ещё в клипе она порвала ухо подруге.» И Джемма нашла этот клип!
mikeshu
но с ней нужно быть осторожнее, она часто врет и выдумывает

Добавить комментарий

Сейчас на главной

Новости

Публикации

✦ ИИ  Почему волос может быть прочнее чугуна, но рвётся от небольшой нагрузки

Волос может быть прочнее некоторых марок чугуна на разрыв, но рвётся от небольшой нагрузки. Всё дело в разнице между прочностью материала и прочностью конструкции.

ГАЗ-ММ: американские корни советской легенды

В 1929 году СССР заключил с Генри Фордом соглашение о передаче технологий для строительства автозавода в Нижнем Новгороде. Дипотношений между странами ещё не было, но коммерческая выгода оказалась...

Что за странный бензин E85 на некоторых американских заправках

Человеку из СНГ не так сложно перестроиться для вождения автомобиля в США: ПДД и знаки схожи, если знаешь английский — ориентироваться на дорогах просто. А что же топливные...

О чём молчат компьютерные мастера: 10 частых ошибок при сборке ПК

Сборка компьютера — увлекательный, но кропотливый процесс, требующий от человека немалых технических знаний. Однако даже опытные сборщики порой допускают ошибки. В этом небольшом материале мы кратко..

Чай ройбуш: из чего его получают и чем он онтличается от обычного чая

Чай ройбуш, известный также как ройбос, представляет собой травяной напиток, который давно стал неотъемлемой частью культуры Южной Африки и постепенно завоевал популярность по всему миру. В отличие...

Кимчи-ччигэ: как выдержанное кимчи делает корейский суп глубже и насыщеннее

У свежего кимчи есть звонкость: капуста ещё хрустит, чеснок и перец звучат резко, кислота только намечается. Через месяцы тот же продукт меняется. Лист становится мягче, запах —...