ChatGPT против Claude: сравниваем топовые нейронки на 6 задачах

Пост опубликован в блогах iXBT.com, его автор не имеет отношения к редакции iXBT.com
| Обзор | ИИ, сервисы и приложения

ChatGPT и Claude — это самые популярные и мощные инструменты на рынке ИИ сейчас. Обе нейронки умеют писать тексты, считать таблицы и собирать файлы. Мне захотелось сравнить и понять, какая же из них все-таки лучше. Но на простых задачах этого не поймешь — они решат их быстро и без ошибок.

Поэтому я подготовился и собрал 6 задач: написать текст, разобраться в грязной таблице, починить чужой код, собрать калькулятор, ответить по большому документу и сделать презентацию для инвестора. В три задачи я заранее подложил ловушки, но моделям про них, само собой, ничего не сказал.

Тестировал ChatGPT на модели с очень высоким усилием мышления и Claude Fable 5.1 в режиме Extra. Каждую задачу запускал в новом чате, память и персонализацию я отключал, чтобы нейронки не подстраивались под меня, а работали с голым заданием.

Каждую задачу оценивал по 10-балльной шкале. Баллы складывались из четырёх пунктов: выполнены ли условия задания, сходятся ли цифры с правильным ответом, поймана ли ловушка и удобно ли пользоваться тем, что нейронка выдала.

Пишем текст по заданию

Первым делом я попросил обе нейронки написать статью про то, почему домашний Wi-Fi тормозит вечером.

Вообще, у меня есть свой набор правил и примеров, по которому я обычно гоняю нейронку в несколько заходов, но здесь я решил пойти максимально простым путем и уместить всё в один запрос.

В задании я написал так:

пишем для обычных людей, а не для сетевых инженеров; тон спокойный, без рекламы, обращение на «вы» объём 4000-5000 знаков; подзаголовков не больше четырёх; у каждого сильного совета называть границы — кому и когда он не поможет; цифры не выдумывать, а если приводишь, говорить, откуда она.

Отдельным блоком перечислил машинные штампы, которых быть не должно: противопоставления «это не X, это Y», рубленые фразы без подлежащего, ритм «тормозит — перезагрузите», перечисления по три с одинаковым ритмом и канцелярит в духе «данный инструмент является решением».

ChatGPT справился за 1 минуту и выдал текст отдельным документом прямо в чате. Claude ответил примерно за то же время и тоже выдал отдельный документ.

Формально оба задание выполнили. Я прогнал тексты своим скриптом, который ищет те самые штампы из списка: запрещённых оборотов ноль, перечислений по три ноль, противопоставлений ноль. По объёму тоже попали: у ChatGPT получилось 4833 знака, у Claude — 4974.

ChatGPT выдал текст отдельным документом и сам сослался на справки Google и Apple
ChatGPT выдал текст отдельным документом и сам сослался на справки Google и Apple
Автор: Михаил Шумовский

ChatGPT, когда я запретил выдумывать цифры, сам полез в поиск и расставил ссылки на справки Google и Apple.

Как ту же тему раскрыл Claude
Как ту же тему раскрыл Claude
Автор: Михаил Шумовский

Claude пошёл другим путём и вытащил конкретику из стандартов связи. Объяснил, что в диапазоне 2,4 ГГц всего три канала, которые не мешают друг другу, поэтому вечером там тесно. Привёл в пример скорости: телефон на 2,4 ГГц вытянет максимум 144 Мбит/с, а на 5 ГГц — 867. И предупредил про дешёвый усилитель в розетку: тот повторяет каждый пакет на том же канале, скорость за ним падает примерно вдвое, а эфир забивается сильнее.

По фактуре у Claude получился более подробный и полезный текст. Но вот читать мне приятнее ответ ChatGPT: он понятнее донес саму мысль и лучше провел меня как читателя по материалу.

Сравните сами. ChatGPT: «Дома одновременно включаются телевизор, ноутбуки, телефоны, приставка, облачные копии, а соседские роутеры занимают тот же радиоэфир». Claude про то же: «Соседи вернулись домой и включили видео, а их сети делят с вашей одни частоты». Второй вариант точнее, но дальше у него в каждом абзаце идут гигагерцы и мегабиты — местами получился справочник, а не статья.

Но даже с учетом условно выполненного задания высокие баллы я не поставлю никому — ни один из текстов мне не нравится по стилистике. А зная, как хорошо они могут писать, ставить им выше 8 баллов будет кощунством. Поэтому ChatGPT я дам 6, Claude — 5.

Проверяем таблицу на 2900 строк

Дальше я придумал выгрузку заказов интернет-магазина за год и от души её испортил:

  • добавил 45 полных дублей;
  • 554 даты текстом в трёх форматах;
  • 181 строку с разнобоем в городах («Мск», «г. Москва», «Екб»);
  • 30 цен текстом вида «6 490 ₽»
  • 22 пустые суммы и 14 сумм с минусом у выполненных заказов.

Плюс добавил 200 отменённых заказов, которые в выручку идти не должны.

Кусок исходной таблицы: дубль, минус, пустая сумма, цена текстом и сокращённые города
Кусок исходной таблицы: дубль, минус, пустая сумма, цена текстом и сокращённые города
Автор: Михаил Шумовский

А ещё я добавил главную ловушку. Дубли и дорогие отменённые заказы я собрал в одном месяце — в ноябре. Смысл такой: если нейронка посчитает выручку как есть, то ноябрь наберёт 3,71 млн рублей и выйдет на первое место по доходам. Но на самом деле 222 тысячи рублей там набежит от дублей, а еще почти 1,5 млн — это отменённые заказы, деньги по которым магазин не получил. Уберите их, почините минусы и пустые суммы — у ноября останется 2,06 млн, и лучшим месяцем станет декабрь с 2,27 млн.

Попросил я простое: найти все проблемные строки и сказать, сколько их, вернуть чистый Excel, посчитать выручку по месяцам только по выполненным заказам, построить график и назвать лучший месяц, худший и категорию-лидера.

ChatGPT думал над задачей 20 минут — это самый долгий ответ за весь тест. Claude потратил примерно столько же.

Таблица найденных проблем с количеством строк от ChatGPT
Таблица найденных проблем с количеством строк от ChatGPT
Автор: Михаил Шумовский

Обе нейронки нашли все шесть видов ошибок и назвали точные количества. Обе не попались на ноябрь. И у обеих выручка по всем двенадцати месяцам сошлась с моим эталоном до рубля: 19 870 310 рублей за год, лучший месяц декабрь, худший февраль, а больше всего денег принесла электроника — 12,07 млн.

Файлы я скачал и открыл. У ChatGPT получилась книга на восемь вкладок. На первой дашборд: крупные плашки с итогами и диаграмма. Дальше чистые заказы, сводки, журнал всех 843 исправлений, удалённые дубли и отдельная вкладка «Проверить суммы» с сомнительными строками.

Дашборд в файле от ChatGPT
Дашборд в файле от ChatGPT
Автор: Михаил Шумовский

Ещё ChatGPT сделал то, чего я не ожидал: написал, что 14 сумм с минусом могут быть не ошибкой знака, а возвратами денег покупателям, и посчитал выручку в двух вариантах — 19 870 310 рублей, если минусы исправить, и 19 689 210, если оставить.

Чистая таблица от Claude
Чистая таблица от Claude
Автор: Михаил Шумовский

У Claude файл получился скромнее, всего четыре вкладки. Зато сводки он собрал формулами: если потом поправить любую строку в данных, итоги пересчитаются сами.

График выручки по месяцам от Claude
График выручки по месяцам от Claude
Автор: Михаил Шумовский

И добавил своё наблюдение: за год ошибки почти гасят друг друга — лишние 355 тысяч от дублей примерно равны 344 тысячам, которые съедают минусы и пустые суммы.

Обе нейронки получают по 10 баллов: задача была самой трудоёмкой из шести, а результат сошёлся до рубля. Но файлы у них получились для разных людей. Книга ChatGPT с журналом правок пригодится тому, кто потом будет отчитываться, откуда взялась каждая цифра. Файл Claude на формулах удобнее тому, кто продолжит работать с этими данными дальше.

Улучшаем код

Здесь надо честно сказать: я не программист и не знал, как правильно подготовить для вас сравнение по коду. Поэтому задачу мы придумывали вместе с Claude. Он предложил сценарий: взять типовую работу, которую в реальности отдают нейросети, — разбор логов сайта. Сам написал для теста рабочий скрипт, сам заложил в него ошибки и не стал перечислять, какие именно.

Чтобы это было честно, задачу обеим нейронкам я отдавал в новом чате с отключённой памятью: ни ChatGPT, ни Claude не видели ни переписки, где задача придумывалась, ни списка заложенных ошибок. А результат я потом проверял не на слово: скачал оба исправленных скрипта, прогнал у себя на компьютере и сверил цифры.

Теперь объясню, что это за задача, потому что без этого дальше будет непонятно.

Любой сайт записывает каждое обращение к себе отдельной строкой: кто зашёл, во сколько, на какую страницу, что ответил сервер и сколько секунд думал. Такой файл называется логом, и в моем тестовом примере в нём набралось 45 тысяч строк. Руками все эти записи не отсмотришь, поэтому их обычно проверяют скриптами.

Наш скрипт считает шесть вещей: сколько было обращений и разных посетителей, пять самых популярных страниц, долю ошибок двух видов (4xx — виноват посетитель или ссылка, 5xx — сломался сервер), скорость ответа и час пик.

Кусок лога с обрезанной строкой и фрагменты кода с ошибками
Кусок лога с обрезанной строкой и фрагменты кода с ошибками
Автор: Михаил Шумовский

Внутри скрипта оказалось 5 ошибок:

  • Скрипт падал на обрезанных строках, а такие есть в любом логе.
  • Разных посетителей искал самым медленным способом: для каждой новой строки перебирал весь список найденных.
  • Ошибки посетителя и поломки сервера сваливал в одну кучу.
  • Одну и ту же страницу с разными хвостами адреса считал разными страницами.
  • Криво считал скорость ответа сайта — брал время случайного запроса вместо честного расчёта.

В цифрах это выглядело так. Долю ошибок скрипт показывал 10,29% вместо правильных 8,64%. Время ответа сайта занижал: 0,307 секунды вместо настоящих 0,453, то есть сайт казался шустрее, чем он есть. В топ популярных страниц у него не попадал каталог, хотя это самая посещаемая страница магазина. А на сам разбор лога он тратил 3,7 секунды — долго для такого файла.

Правильные цифры я, опять же, знал заранее: Claude отдельно посчитал их, и они стали эталоном для проверки.

ChatGPT потратил на задачу 16 минут, Claude — примерно 13. Обе нейронки нашли все пять заложенных ошибок и добавили к ним свои находки.

Разбор ошибок от ChatGPT
Разбор ошибок от ChatGPT
Автор: Михаил Шумовский

ChatGPT нашёл ещё три: падение на пустом файле, ломкий разбор строки по пробелам и отсутствие проверок значений (сложно, согласен). И прицепился к самой формуле скорости: даже если список отсортировать, она ошибается на один элемент, когда 0,95 от числа строк даёт целое число. Такую тонкость в скрипт никто специально не закладывал, ChatGPT докопался до неё сам ;)

Замер скорости до и после у ChatGPT
Замер скорости до и после у ChatGPT
Автор: Михаил Шумовский

Разбор ошибок у Claude
Разбор ошибок у Claude
Автор: Михаил Шумовский

Claude посчитал то, о чём я не просил: если бы скрипт не падал на кривых строках, он всё равно потерял бы 65 нормальных запросов и 17 посетителей. И нашёл похожую подставу: окажись между лишними кавычками число, скрипт молча принял бы его за время ответа и никто бы этого не заметил.

Результат прогона исправленного скрипта у Claude
Результат прогона исправленного скрипта у Claude
Автор: Михаил Шумовский

Дальше я скачал оба скрипта и прогнал их у себя на компьютере. Все цифры в отчёте совпали с эталоном. Разбор всего лога у скрипта Claude занял 0,14 секунды, у скрипта ChatGPT — 0,37. Напомню, сломанная версия тратила на то же самое 3,7 секунды.

Ещё я просил написать тесты — маленькие проверки, которые прогоняют скрипт на известных данных и сверяют результат с правильным ответом. У ChatGPT получилось 55 тестов, и запускались они без установки лишних программ. Я подсунул им вместо исправленного скрипта исходный, сломанный: тесты дружно ругнулись, значит, словили, что должны.

У Claude получилось 35 тестов, но им была нужна отдельная библиотека, и написаны они были под новую версию скрипта — на старом просто не запускались.

В общем, здесь ставлю по 10 баллов обоим участника: все ошибки найдены, скрипты после правок работают, цифры совпали.

Создаем интерактивный калькулятор

Для следующей задачи я решил проверить, как нейронки сделают что-нибудь полезное и интерактивное. Попросил собрать ипотечный калькулятор прямо в чате: со стоимостью квартиры, взносом в рублях или процентах, ставкой, сроком, типом платежа и разовым досрочным погашением, где можно выбрать, что уменьшать — срок или платёж. Плюс график остатка долга и таблица платежей по месяцам.

Claude собрал калькулятор прямо в окне разговора: его можно открыть тут же, ввести свои цифры и сразу получить расчёт.

Калькулятор Claude работает внутри чата
Калькулятор Claude работает внутри чата
Автор: Михаил Шумовский

ChatGPT так не смог и поэтому сделал отдельный файл, который открывается предпросмотром в чате. А подсчеты в нем можно сделать только после скачивания.

Калькулятор ChatGPT: отдельный файл с предпросмотром
Калькулятор ChatGPT: отдельный файл с предпросмотром
Автор: Михаил Шумовский

Правильные ответы я опять посчитал заранее своей таблицей. Условия: квартира 9 млн, взнос 2 млн, ставка 21%, срок 25 лет. По ним платёж выходит 123 176,40 рубля, переплата за все годы — почти 30 млн. Ещё я просил показывать нужный доход, чтобы платёж не съедал больше половины зарплаты. По моим условиям это 246 353 рубля.

Отдельно проверил досрочное погашение миллионом на 24-м месяце. Если сокращать срок, кредит закроется за 134 месяца вместо 300 и сэкономит 19,5 млн процентов. Если тем же миллионом уменьшать платёж — экономия всего 3,87 млн. Разница между двумя вариантами почти в пять раз, и на ней калькуляторы обычно и врут.

Так вот, обе нейронки посчитали всё до рубля: и платёж, и переплату, и нужный доход, и оба варианта досрочного погашения. Ни одного расхождения с моей таблицей.

У Claude сверх задания появились выгрузка таблицы платежей в CSV и пунктирная линия на графике «как было бы без досрочного погашения» — сразу видно, сколько лет вы себе отыграли. У ChatGPT на графике тоже появился пунктир в месте досрочного платежа, а если навести курсор, всплывает подсказка с остатком долга на этот месяц.

Claude я поставлю 10 баллов, ChatGPT — 9. Расчёты одинаковые, но работающий внутри чата калькулятор удобнее, чем файл, который надо открывать отдельно. Лично мне так проще, хотя понимаю, что кому-то отдельный файл как раз нужнее.

Проверяем большой документ на 47 страниц

Дальше я решил проверить, как нейронки читают большие документы. Я собрал PDF с официальным текстом правил дорожного движения в действующей редакции: 47 страниц вместе с перечнем неисправностей.

Задавать решил по три вопроса и требовать к каждому ответу номер пункта и страницу, чтобы можно было проверить.

Первые два вопроса обычные: с какого возраста ребёнка можно везти на переднем сиденье без детского кресла и какая минимальная глубина протектора у летних и зимних шин. Третий вопрос — ловушка: какой штраф за проезд на красный свет. Штрафов в правилах нет, они в другом документе, в КоАП. Нейросеть, которая ответит суммой, выдаст знание из головы за ответ по документу. (я ожидаю, что нейронка скажет, мол, я то знаю и все проверила, но конкретно в этом документу инфы не было)

Ответ ChatGPT с номерами пунктов и страниц
Ответ ChatGPT с номерами пунктов и страниц
Автор: Михаил Шумовский

Ответ Claude
Ответ Claude
Автор: Михаил Шумовский

Ни одна нейронка на уловку не попалась. Обе ответили: с 12 лет, потому что детей от 7 до 11 лет на переднем сиденье возят только в удерживающем устройстве. Обе дали правильные цифры по протектору: больше 1,6 мм для обычных шин и больше 4 мм для зимних на снегу и льду. И обе прямо сказали, что размера штрафа в документе нет.

Номера страниц я проверил по файлу — все до единой верные, у обеих.

ChatGPT ответил компактнее и уложился в 2 минуты. Claude дал чуть больше: добавил пункт про ремень безопасности, упомянул индикаторы износа на шинах и отдельно оговорил, что слова «летние» в документе вообще нет, это общая норма для шин.

Снова по 10 баллов: обе прочитали документ целиком, ничего не выдумали и не постеснялись сказать «в документе этого нет». Для работы с договорами и инструкциями это главное.

Делаем презентацию

На сладенькое я решил оставить самое интересное — создание презентаций.

Я написал заметки владельца кофейни в Казани: выручка по месяцам за год, расходы, план второй точки и смета на открытие. Попросил сделать из них презентацию для инвестора на 8-10 слайдов, посчитать срок окупаемости и показать расчёт, а к каждому слайду добавить заметки для выступающего.

В смету я подложил ошибку. Четыре строки: ремонт, оборудование, мебель и запуск — дают в сумме 4,9 млн рублей, а итогом внизу написано 4,8 млн.

Кусок заметок: строки сметы дают 4,9 млн, а итог написан 4,8 млн
Кусок заметок: строки сметы дают 4,9 млн, а итог написан 4,8 млн
Автор: Михаил Шумовский

ChatGPT собрал презентацию за 7 минут, Claude — примерно за столько же. Оба выдали файл PowerPoint на 10 слайдов, где диаграммы настоящие, а не вставленные картинкой: такой график можно потом поправить прямо в презентации. К каждому слайду обе нейронки написали заметки для выступающего. Цифры выручки на графиках я сверил со своими — все двенадцать значений верные.

Титульный слайд от ChatGPT
Титульный слайд от ChatGPT
Автор: Михаил Шумовский

Слайд с выручкой по месяцам
Слайд с выручкой по месяцам
Автор: Михаил Шумовский

Срок окупаемости обе посчитали правильно и показали расчёт: у ChatGPT вышло 37,8 месяца, у Claude — 38-й месяц, то есть около трёх лет. Мой эталон — 38 месяцев.

Пошаговый расчёт окупаемости у ChatGPT
Пошаговый расчёт окупаемости у ChatGPT
Автор: Михаил Шумовский

А вот со сметой вышло по-разному. ChatGPT расхождение заметил и вынес его прямо в заголовок слайда: «Смета: 4,8 млн ₽ заявлено — 4,9 млн ₽ по строкам». Мало того, он посчитал окупаемость для обеих сумм: 37,8 месяца при 4,8 млн и 38,7 при 4,9 млн.

Claude разницу не увидел. Больше того, он поставил внизу слайда строку «Ремонт и дизайн 2,1 · оборудование 1,9 · мебель 0,5 · запуск и маркетинг 0,4 = 4,8 млн ₽». Точки здесь вместо плюсов, то есть слайд утверждает, что 2,1 + 1,9 + 0,5 + 0,4 равно 4,8. Сложите сами;)

Слайд Claude, где 2,1 + 1,9 + 0,5 + 0,4 почему-то равно 4,8 млн
Слайд Claude, где 2,1 + 1,9 + 0,5 + 0,4 почему-то равно 4,8 млн
Автор: Михаил Шумовский

Справедливости ради, в остальном презентация Claude сильная: пять диаграмм вместо двух и отдельный слайд с тем, что будет со сроком окупаемости, если выручка окажется на 10% ниже плана. И он честно предупредил, что добавил инвестору два обещания, которых в заметках не было: ежемесячную отчётность и доступ к учёту. Написал прямо: если не готовы — уберите.

ChatGPT я поставлю 10 баллов, Claude — 8. Два балла снимаю за смету (хотя дизайн у Claude в 100 раз круче).

Подводим итоги

А итоги ожидаемые:

Задача ChatGPT Claude
Текст по редзаданию 6 5
Грязная таблица 10 10
Чужой код с ошибками 10 10
Калькулятор в чате 9 10
Документ на 47 страниц 10 10
Презентация для инвестора 10 8
Итого 55 53

Разрыв в два балла из 60 — это ничья, если честно. Четыре задачи из шести обе нейронки сделали одинаково: до рубля, до номера страницы, до последней найденной ошибки в коде. Хотя врать не буду — Claude со своей ошибкой в презентации сильно разочаровал. От него я такого никак не ожидал.

Так, а какую нейронку использовать? А любую. Доступ к обоим заблокирован из России. Обе оплатить российскими картами нельзя. Разницы в качестве ответов практически нет. Поэтому и однозначно кого-то посоветовать я не могу;)

Изображение в превью:
Автор: GPT Image
Источник: GPT Image
Автор не входит в состав редакции iXBT.com (подробнее »)
Об авторе
Главный редактор медиа о неросетях. Автор телеграм-канала о нейросетях Миша, давай по новой

6 комментариев

Добавить комментарий

Gilbert_Leps
Ещё бы добавить в такие тесты задания на перевод художественного текста с англ., исп., и итальянского языков на русский.
mikeshu
ох, ну это для меня будет сложно)
Gilbert_Leps
ох, ну это для меня будет сложно)

Ну тогда только с английского.
Gilbert_Leps
А вообще, самая информированная ИИ, это гугловская, как-то я попросил её найти один русский клип далеко не самой популярной певицы по весьма смутному описанию не зная ни имени исполнительницы ни названия. Примерно по такому запросу: «там пелось про черёмуху, и про то что он женат и любит своих дочерей, но она всё равно его любит и уведёт. Ещё в клипе она порвала ухо подруге.» И Джемма нашла этот клип!
mikeshu
но с ней нужно быть осторожнее, она часто врет и выдумывает

Добавить комментарий

Сейчас на главной

Новости

Публикации

Почему дома кофе получается горьким или водянистым: 6 ошибок, которые портят вкус

Купили нормальный кофе, засыпали свежие зерна в кофемашину, нажали заветную кнопку — и снова что-то не то. Вместо насыщенного кофе получается горькая жидкость, которую хочется разбавить...

✦ ИИ  Почему после массовых вымираний жизнь на Земле не исчезала, а обязательно восстанавливалась и даже развивалась еще быстрее

Почему после массовых вымираний жизнь на Земле не только не исчезала, а еще и получала новый импульс к развитию? Жизнь не только восстанавливалась, но и становилась разнообразнее.

Как передний привод помог сделать семейные автомобили просторнее и дешевле

У семейных автомобилей прошлого и современных хетчбэков различаются не только кузова, фары и приборные панели. Под полом произошла менее заметная перемена: длинный вал, передававший вращение к...

Прошло 7 лет с последней победы Себастьяна Феттеля в Формуле-1: вспоминаем Гран-при Сингапура 2019 года

  • Мнение
  • Спорт
22 сентября 2019 года на сингапурской трассе «Марина-Бей» четырёхкратный чемпион Формулы-1 Себастьян Феттель выиграл свою последнюю гонку. На тот момент ещё никто не мог предположить, что он...

Почему медведи иногда убегают от домашних кошек, хотя весят в десятки раз больше

Домашняя кошка весит несколько килограммов, медведь — несколько сотен. Кажется, при такой разнице в размерах заранее понятно, кто кому уступит. Но в записях с домашних камер иногда...

✦ ИИ  Почему волос может быть прочнее чугуна, но рвётся от небольшой нагрузки

Волос может быть прочнее некоторых марок чугуна на разрыв, но рвётся от небольшой нагрузки. Всё дело в разнице между прочностью материала и прочностью конструкции.