Чек на $100 тысяч для несуществующей компании: как появился Google

Пост опубликован в блогах iXBT.com, его автор не имеет отношения к редакции iXBT.com
| Статья | История

В конце девяностых найти нужную информацию в интернете было гораздо сложнее, чем сегодня. Поисковик мог найти страницу, где встречались нужные слова, но не всегда понимал, насколько ей можно доверять.

Аспиранты Стэнфордского университета Ларри Пейдж и Сергей Брин предложили учитывать, какие сайты ссылаются на найденную страницу, оценивать авторитет этих источников и на основе полученных данных определять место страницы в выдаче результатов поиска. Так появилась идея, которая впоследствии сделала Google одним из главных поисковиков мира.

Фото Ларри Пейджа и Сергея Брина в 2003 году
Фото Ларри Пейджа и Сергея Брина в 2003 году
Автор: Ehud Kenan Источник: en.wikipedia.org

Регистрация Google как юридического лица 4 сентября 1998 года осталась в истории как курьёз. Инвестор Энди Бехтольшайм, выслушав презентацию аспирантов, выписал чек на 100 тысяч долларов на имя компании Google Inc.

Проблема заключалась в том, что никакой Google Inc. в природе ещё не существовало — Брин и Пейдж в это время развивали проект BackRub на серверах Стэнфордского университета. Чтобы внести деньги на банковский счёт, партнёрам пришлось экстренно бежать к юристам и оформлять компанию под название из чека.

Логотип Google 1998 года
Логотип Google 1998 года
Автор: Google inc. (Public Domain) Источник: commons.wikimedia.org

От поиска слов к графу связей

До PageRank поисковики решали проблему поиска по растущему вебу по-разному. Yahoo! делал ставку на ручной каталог: редакторы отбирали сайты, распределяли их по категориям и добавляли короткие описания. AltaVista пошла по более очевидному пути — сопоставляла запрос с текстом страницы и учитывала, сколько раз нужные слова встречались на ней. Вскоре владельцы сайтов научились этим пользоваться. Ключевые слова начали повторять десятки раз и даже прятать на странице, окрашивая их в цвет фона.

Пейдж и Брин предложили учитывать не только содержание страницы, но и её связи с другими сайтами. Ссылка могла рассматриваться как рекомендация, но ценность таких рекомендаций была разной: ссылка с авторитетного ресурса могла весить больше, чем множество ссылок с малоизвестных страниц. Отсюда возникла главная особенность PageRank: вес страницы зависел от авторитетности ресурсов, которые на неё ссылались.

Чтобы рассчитать этот показатель, Пейдж и Брин построили модель «случайного серфера» — условного пользователя, который случайным образом переходит по гиперссылкам. Всю сеть представили как граф, где страницы — это узлы, а ссылки — связи между ними. Поисковый робот BackRub собирал данные о страницах и ссылках между ними.

Сначала всем страницам присваивали равный стартовый вес — условно назовём его баллами. Затем алгоритм передавал часть этих баллов по исходящим ссылкам. Этот процесс повторяли круг за кругом: баллы перетекали по сети, пока их распределение не стабилизировалось. В итоге страницы, набравшие больше всего баллов, получали самый высокий PageRank.

А вот с железом у будущего Google всё было гораздо прозаичнее. Для экспериментов требовалось много дискового пространства, а денег на дорогую серверную технику у Пейджа и Брина не было. Один из первых серверов они собрали из доступных компонентов. Его корпус сделали в том числе из Lego. Внутри стояли десять дисков по 4 ГБ. Сегодня такой объём выглядит почти смешным, но тогда этого хватало для экспериментов с уже довольно заметной частью веба.

Первый сервер Google
Первый сервер Google
Автор: By Steve Jurvetson Источник: en.wikipedia.org

Как SEO научилось обходить PageRank

Чистая математическая модель PageRank содержала уязвимость: разработчики исходили из предположения, что ссылки проставляются искренне. Как только поисковый трафик стал приносить миллионы долларов, веб-мастера быстро поняли, что структуру связей можно сымитировать.

Любой измеримый критерий ценности неизбежно превращается в объект манипуляции.

Появилась индустрия SEO — поисковой оптимизации, то есть методов продвижения сайтов на более высокие позиции в результатах поиска. Оптимизаторы начали конструировать искусственные ссылочные графы: создавались каталоги, биржи ссылок и целые сети сайтов, предназначенные главным образом для размещения ссылок друг на друга и передачи «авторитета» нужному коммерческому ресурсу.

Борьба инженеров Google против поискового спама растянулась на десятилетия. В 2003 году Google провёл крупное обновление поискового алгоритма Florida, которое изменило принципы ранжирования и затронуло сайты, использовавшие методы искусственного продвижения. В 2011 году появился Panda — алгоритм, направленный против низкокачественного контента. Год спустя алгоритм Penguin научился распознавать искусственные ссылки и другие способы искусственно повышать позиции сайта в поиске.

Поисковик вместо веба и переход к ИИ

Позже в ранжирование внедрили машинное обучение для обработки поисковых запросов. В 2015 году появилась система RankBrain, которая помогала понимать необычные формулировки запросов и находить для них подходящие страницы. В 2019 году Google начал использовать модель BERT, способную лучше учитывать смысл слов в зависимости от их положения и контекста внутри запроса.

Затем произошёл ещё один заметный сдвиг — не очень приятный для авторов статей и владельцев сайтов. В 2024 году Google начал показывать AI Overviews — ответы, сформированные искусственным интеллектом непосредственно в поисковой выдаче. В 2025 году компания стала развивать AI Mode, где пользователь может получать развёрнутый ответ на сложный запрос вместо привычного списка ссылок. Поисковик постепенно начал самостоятельно собирать и выдавать информацию из доступных материалов, что привело к сокращению числа переходов на сайты, где эта информация была опубликована.

PageRank не исчез из поисковой системы — Google по-прежнему использует его при ранжировании страниц. Однако роль самих сайтов изменилась: Google всё чаще использует опубликованную на них информацию непосредственно в поисковой выдаче. Веб-страница перестаёт быть обязательной точкой назначения: пользователь получает нужные сведения без перехода на первоисточник.

Изображение в превью:
Автор: Asoundd
Источник: en.wikipedia.org

2 комментария

j
В какой-то момент алгоритм стал слишком умным и начал подсовывать покупки даже там, где контекст совсем не про шопинг, либо скрывать неполиткорректные результаты.
dimon-ru-80
Как говориться: «Но это уже другая история»))

Добавить комментарий

Сейчас на главной

Новости

Публикации

Почему яблоки сморщиваются и гниют при хранении: ошибки, которые начинаются ещё в саду

После сбора яблоки ещё хрустят и пахнут садом, а спустя несколько недель часть урожая уже приходится перебирать. Одни плоды становятся вялыми, на других появляются бурые пятна. При этом два ящика в...

SEO умерло, да здравствует GEO: как нейросети продают ваш товар без единого клика — и как это измерить

Двадцать пять лет цифровая экономика развивалась благодаря одной технической особенности: действию пользователя предшествовал переход по ссылке. Человек видел объявление или строчку в поисковой...

Самые дорогие монеты СССР: 10 экземпляров стоимостью до 10 миллионов рублей

  • Тематическая подборка
  • Оффтопик
Рынок советской нумизматики в его нынешнем виде сформировался в конце 1990-х — начале 2000-х, когда массовый коллекционер получил доступ к аукционам, а первые специализированные...

Хлеб в живописи: что интересного на новой выставке в «Зотове»

Новый проект в центре «Зотов» посвящен истории хлеба. Впрочем, не многовековой, конечно: контент выставки охватывает лишь конец XIX - первую половину XX века, но делает это вполне...

Что делать, если на вас напал индюк: три ошибки при встрече с наглой птицей

Взрослый самец индюка весит до 16-18 килограммов и на короткой дистанции развивает скорость до 30 километров в час. При этом в прыжке он бьет роговыми шпорами длиной до трех сантиметров, метя на...

Почему популяция серебряного карася может состоять из одних самок: как устроен гиногенез

В рыболовной практике средней полосы России есть наблюдение, с которым регулярно сталкиваются при чистке улова серебряного карася: из пятидесяти пойманных рыб все пятьдесят оказываются самками с...