Чек на $100 тысяч для несуществующей компании: как появился Google

Пост опубликован в блогах iXBT.com, его автор не имеет отношения к редакции iXBT.com
| Статья | История

В конце девяностых найти нужную информацию в интернете было гораздо сложнее, чем сегодня. Поисковик мог найти страницу, где встречались нужные слова, но не всегда понимал, насколько ей можно доверять.

Аспиранты Стэнфордского университета Ларри Пейдж и Сергей Брин предложили учитывать, какие сайты ссылаются на найденную страницу, оценивать авторитет этих источников и на основе полученных данных определять место страницы в выдаче результатов поиска. Так появилась идея, которая впоследствии сделала Google одним из главных поисковиков мира.

Фото Ларри Пейджа и Сергея Брина в 2003 году
Фото Ларри Пейджа и Сергея Брина в 2003 году
Автор: Ehud Kenan Источник: en.wikipedia.org

Регистрация Google как юридического лица 4 сентября 1998 года осталась в истории как курьёз. Инвестор Энди Бехтольшайм, выслушав презентацию аспирантов, выписал чек на 100 тысяч долларов на имя компании Google Inc.

Проблема заключалась в том, что никакой Google Inc. в природе ещё не существовало — Брин и Пейдж в это время развивали проект BackRub на серверах Стэнфордского университета. Чтобы внести деньги на банковский счёт, партнёрам пришлось экстренно бежать к юристам и оформлять компанию под название из чека.

Логотип Google 1998 года
Логотип Google 1998 года
Автор: Google inc. (Public Domain) Источник: commons.wikimedia.org

От поиска слов к графу связей

До PageRank поисковики решали проблему поиска по растущему вебу по-разному. Yahoo! делал ставку на ручной каталог: редакторы отбирали сайты, распределяли их по категориям и добавляли короткие описания. AltaVista пошла по более очевидному пути — сопоставляла запрос с текстом страницы и учитывала, сколько раз нужные слова встречались на ней. Вскоре владельцы сайтов научились этим пользоваться. Ключевые слова начали повторять десятки раз и даже прятать на странице, окрашивая их в цвет фона.

Пейдж и Брин предложили учитывать не только содержание страницы, но и её связи с другими сайтами. Ссылка могла рассматриваться как рекомендация, но ценность таких рекомендаций была разной: ссылка с авторитетного ресурса могла весить больше, чем множество ссылок с малоизвестных страниц. Отсюда возникла главная особенность PageRank: вес страницы зависел от авторитетности ресурсов, которые на неё ссылались.

Чтобы рассчитать этот показатель, Пейдж и Брин построили модель «случайного серфера» — условного пользователя, который случайным образом переходит по гиперссылкам. Всю сеть представили как граф, где страницы — это узлы, а ссылки — связи между ними. Поисковый робот BackRub собирал данные о страницах и ссылках между ними.

Сначала всем страницам присваивали равный стартовый вес — условно назовём его баллами. Затем алгоритм передавал часть этих баллов по исходящим ссылкам. Этот процесс повторяли круг за кругом: баллы перетекали по сети, пока их распределение не стабилизировалось. В итоге страницы, набравшие больше всего баллов, получали самый высокий PageRank.

А вот с железом у будущего Google всё было гораздо прозаичнее. Для экспериментов требовалось много дискового пространства, а денег на дорогую серверную технику у Пейджа и Брина не было. Один из первых серверов они собрали из доступных компонентов. Его корпус сделали в том числе из Lego. Внутри стояли десять дисков по 4 ГБ. Сегодня такой объём выглядит почти смешным, но тогда этого хватало для экспериментов с уже довольно заметной частью веба.

Первый сервер Google
Первый сервер Google
Автор: By Steve Jurvetson Источник: en.wikipedia.org

Как SEO научилось обходить PageRank

Чистая математическая модель PageRank содержала уязвимость: разработчики исходили из предположения, что ссылки проставляются искренне. Как только поисковый трафик стал приносить миллионы долларов, веб-мастера быстро поняли, что структуру связей можно сымитировать.

Любой измеримый критерий ценности неизбежно превращается в объект манипуляции.

Появилась индустрия SEO — поисковой оптимизации, то есть методов продвижения сайтов на более высокие позиции в результатах поиска. Оптимизаторы начали конструировать искусственные ссылочные графы: создавались каталоги, биржи ссылок и целые сети сайтов, предназначенные главным образом для размещения ссылок друг на друга и передачи «авторитета» нужному коммерческому ресурсу.

Борьба инженеров Google против поискового спама растянулась на десятилетия. В 2003 году Google провёл крупное обновление поискового алгоритма Florida, которое изменило принципы ранжирования и затронуло сайты, использовавшие методы искусственного продвижения. В 2011 году появился Panda — алгоритм, направленный против низкокачественного контента. Год спустя алгоритм Penguin научился распознавать искусственные ссылки и другие способы искусственно повышать позиции сайта в поиске.

Поисковик вместо веба и переход к ИИ

Позже в ранжирование внедрили машинное обучение для обработки поисковых запросов. В 2015 году появилась система RankBrain, которая помогала понимать необычные формулировки запросов и находить для них подходящие страницы. В 2019 году Google начал использовать модель BERT, способную лучше учитывать смысл слов в зависимости от их положения и контекста внутри запроса.

Затем произошёл ещё один заметный сдвиг — не очень приятный для авторов статей и владельцев сайтов. В 2024 году Google начал показывать AI Overviews — ответы, сформированные искусственным интеллектом непосредственно в поисковой выдаче. В 2025 году компания стала развивать AI Mode, где пользователь может получать развёрнутый ответ на сложный запрос вместо привычного списка ссылок. Поисковик постепенно начал самостоятельно собирать и выдавать информацию из доступных материалов, что привело к сокращению числа переходов на сайты, где эта информация была опубликована.

PageRank не исчез из поисковой системы — Google по-прежнему использует его при ранжировании страниц. Однако роль самих сайтов изменилась: Google всё чаще использует опубликованную на них информацию непосредственно в поисковой выдаче. Веб-страница перестаёт быть обязательной точкой назначения: пользователь получает нужные сведения без перехода на первоисточник.

Изображение в превью:
Автор: Asoundd
Источник: en.wikipedia.org

2 комментария

j
В какой-то момент алгоритм стал слишком умным и начал подсовывать покупки даже там, где контекст совсем не про шопинг, либо скрывать неполиткорректные результаты.
dimon-ru-80
Как говориться: «Но это уже другая история»))

Добавить комментарий

Сейчас на главной

Новости

Публикации

Алиса vs ГигаЧата: сравниваем российские нейронки на 5 задачах

Алиса и ГигаЧат — две главные российские нейросети. Обе бесплатные, обе работают в России без ограничений и обе умеют писать тексты, рисовать картинки и разбирать документы. Мне стало...

✦ ИИ  Тилацина истребили как убийцу овец. А потом выяснилось, что мы сильно переоценили, насколько он был опасен

Тилацина истребляли как убийцу овец, а он, судя по исследованиям, был плохо приспособлен к охоте на крупную добычу. Масштаб угрозы сильно преувеличили — но было поздно.

Обзор гарнитуры xG NEOS

xG NEOS — гарнитура протест. В то время как все пытаются закрыться и соревнуются в шумоподавлении, данное устройство обладает открытой конструкцией с необычным дизайном. Наушники...

✦ ИИ  Почему амбра стоит так дорого и кто покупает «китовую рвоту»

Среди водорослей и обкатанных камней на берегу иногда попадаются невзрачные серые куски, ради которых специалисты готовы обсуждать серьёзные сделки. У них нет блеска драгоценного металла, а запах...

Что нельзя включать в удлинитель: приборы, которым нужна отдельная розетка

Удлинитель легко воспринимать как еще одну настенную розетку. Вилка подходит, прибор заработал и кажется, что вопрос закрыт. Проблемы начинаются позже, когда через несколько дополнительных...

Почему дома кофе получается горьким или водянистым: 6 ошибок, которые портят вкус

Купили нормальный кофе, засыпали свежие зерна в кофемашину, нажали заветную кнопку — и снова что-то не то. Вместо насыщенного кофе получается горькая жидкость, которую хочется разбавить...