Автор не входит в состав редакции iXBT.com (подробнее »)
avatar
Это всего лишь легкое описание модели от OpenAI, которая хранит изображения и текстовые описания к ним в едином векторном пространстве.
Что совершенно никак не уменьшает требуемые объемы к хранению информации с накоплением требуемых для автономной генерации данных.
avatar
Про «Variational Autoencoder (VAE)» можете не рассказывать — это всего лишь сжатие исходных объектов для последующего использования.
Но результатом сжатия будет что?
Правильно — тот же самый исходный объект, только в другой, сжатой форме с вероятной потерей части данных.
И где этот объект будет храниться (в терминологии обсуждения)?
Верно, в базе данных объектов.
И что будет, когда таких объектов и их связей будет огромное количество?
Значительно вырастет объем хранящейся информации.
Оп-па, а про что изначальный спор то?
…
avatar
Здравый смысл и логика категорически против.
Есть, конечно, теорема о бесконечных обезьянах, но это не тот случай, ибо не предусмотрены бесконечные контроллеры результата.
--
Можно генерировать псевдослучайно по базовому алгоритму/шаблону, но тут высока вероятность негативного результата (что мы видим на моем примере со stablediffusionweb выше), можно генерировать на основе существующих данных, но это требует либо сохраненной информации по этим данным, либо доступ к самим данным (о чем я и пишу 100-500й раз).
Хотите опровергнуть: реализуйте на любом современном ИИ любую из предложенных мною выше задач — корректный ответ на генерацию изображения британца и бенгала без базы о кошачьих породах, программу сложения двух чисел на Форт без базы об этом языке программирования, текст по книге без базы про эту книгу.
Сомневаюсь, что смогу получить адекватный ответ, ибо при отсутствии аргументов/доказательств остается только переходить на личности.
avatar
Только что вы мне на
«Не сможет мне автономный генеративный ИИ с базой весов написать программу на Форте, не сможет нарисовать кошек заданных пород, не сможет сделать текст по книге. Просто потому, что он умеет это делать, но не знает ни языка программирования, ни как выглядит порода, ни содержания книги!»
ответили
«Сначала изучи как они работают, можешь просто запустить модель stable diffusion на своем компе(но это гемор) и она бесплатна, а потом делай выводы»
Собственно, поскольку онлайн ИИ не справляется с запросом, то ваша рекомендация тестировать оффлайн неактуальна, что вы сами признали:
«Не будет оффлайн работать лучше, я такого и не заявляю»
--
«нужно настраивать модель под свой запрос если хочешь получить хороший результат»
Воооот!!! А настраивается она на основе входящих данных, т.е. либо базы исходных объектов, либо базы обработки и сохранения этих исходных объектов, но в любом случае — объектов. Без разницы: хранится изображение кота в пиксельной форме, описанной мат-функциями векторной или псевдографике — все равно это объект. И, соответственно, от этого объекта уже будет работать ИИ. И именно база объектов нужна, чтоб генерировать изображение кота. Плюс в базе должны быть параметры цвета, шерсти, положений тела и тп. ИИ по объекту «кот» на основе «весов» сможет сгенерировать большую кошку, маленькую, на прямых лапах или согнутых, но не сможет никакую без информации об исходном объекте, что я изначально и пытаюсь донести.
avatar
Даже с онлайн-базами stablediffusionweb по запросу «A British shorthair monophonic cat hugs a Bengal cat against the background of the sea» выдает совершенно не то, что заказано. А вы заявляете, что оффлайн работает лучше.
--
Попробовал еще раз по «A British shorthair purple cat hugs a Bengal cat against the background of the sea» и «A British shorthair monochrome gray cat hugs a Bengal cat against the background of the sea» — в результате снова пара полосатых рядом.
И так большинство генеративных ИИ (об этом тоже выше писал): по «A British shorthair monochrome gray cat against the background of the sea» генерируют чаще корректно, но стоит добавить на картинку другую породу — сразу «мозги пухнуть» начинают. А это лишь минимальное усложнение, причем с использованием того, что у этих ИИ уже имеется в базе.
Что же говорить про ИИ без доступа к онлайн-базам, где даже одну породу будет сложностью сгенерировать.
avatar
Уже многократно приводил примеры выше: речь идет именно про автономный генеративный ИИ, от которого без баз объектов толку почти никакого.
Невозможно сгенерировать внятный читаемый текст, не имея базы словарного запаса, невозможно создать изображение объекта, не зная как он должен выглядеть. И если для текстов можно ужаться в несколько террабайт (по крайней мере мой личный архив художественной и технической литературы занимает чуть меньше терра в сжатом состоянии), то с изображениями и видео уже потребуется значительно больший объем.
Генератор случайных чисел на программируемом калькуляторе можно считать автономным генеративным, но это будет совершенно не то, что в современном мире ожидается от ИИ.
--
Еще раз: код ИИ (алгоритмы) с базой обучения (весы) достаточно для работы по определению, дальнейшему обучению, изменению объектов. Но не для генерации! Для генерации должна быть база хотя бы исходных объектов, от которых на основе алгоритмов и обучения будет строиться результат. Но без этого работы не будет, ибо в результате с высокой вероятностью будет не соответствующая запросу чушь.
Практически невозможно получить результат прибавления или умножения, если не знать к чему прибавлять или что умножать! Тут «весы», хранящие «насколько надо прибавить или умножить» не помогут.
Искусственная нейронная сеть, методы векторов или соседей и тп — это лишь алгоритмы, база весов — всего лишь набор определений корректности принятых на основе алгоритмов решений. Но действия нужно применять к объектам!
--
Не сможет мне автономный генеративный ИИ с базой весов написать программу на Форте, не сможет нарисовать кошек заданных пород, не сможет сделать текст по книге. Просто потому, что он умеет это делать, но не знает ни языка программирования, ни как выглядит порода, ни содержания книги!
avatar
Так то да, но по исходной цепочке спор идет о том, что для работы автономного(!!!) генеративного ИИ (т.е. без доступа к сети и, как следствие, к облачным ресурсам) якобы важны только производительность (объем оперативной и скорость процессора), а объем локального хранилища не важен, ибо достаточно базы «оперирования над объектами» без базы самих «оперируемых объектов»; не говоря уже о том, что mov, xor, add и тп команды, как выяснилось благодаря экспертам, без 20гб ОЗУ просто не работают, равно как всплыла и невозможность подгружать и выгружать данные в память/из памяти в процессе работы.
Что же касается 8088..80286 Там была одна проблема: сделать базовый исполняемый в 400-500кб (ибо 640 минус драйвера, «резиденты», оболочка и тп), а уж оперировать дополнительным кодом и данными после можно было до бесконечности, лишь бы объем хранилищ позволял (сложность была лишь в организации адресации при гигантских объемах — приходилось «бить» на куски через собственную адресацию).
(Про «верхнюю память», а после еще расширенную с переходом в виртуальную не упоминаю, ибо это уже ведет к тому, что любое современное устройство потенциально обладает бесконечной оперативкой, упирающейся в объемы… «эксперты» выше не поверят — локального хранилища (при автономной работе))
avatar
Это если после нескольких лет бакалавриата и магистратуры — Data Scientist, а если несколько месяцев у инфоцыган… ;)
avatar
От того, что у устройства будет килобайт памяти вместо терабайта не означает, что оно перестаёт складывать и умножать, равно как и математические правила не изменятся. Это всего лишь производительность: а сделает ИИ обработку запроса за секунду или за год — от этого его суть не изменится. Многотеррабайтная база может и на ПК 40летней давности крутиться, но никто не говорит, что без 100-500 гигагерц и ОЗУ она не база.
ps: Вот когда «data satanist» подтвердит — тогда, может быть, поверю. :)
avatar
Очень спорно
Тут вилочка: с одной стороны намеренная порча чужого имущества, с другой, согласно лицензионному соглашению, не такого уж и чужого.
Все упрется в адвокатов и судей.
В конце концов еще был вариант оперативно перепродать все устройства и уйти в другую экосистему.
avatar
Алгоритм нейронки — это ядро, без данных оно почти бесполезно. Это лишь определение, как оперировать данными. И на разных наборах данных результат будет разным.
Возьмите два ИИ, закройте одному доступ к информации про произведения Гаррисона и попросите обе сгенерировать контент про стальную крысу.
Добавлю: возможно у нас взаимонепонимание, но ваши аргументы воспринимаю в форме «генеративному ии достаточно уметь соединять буквы для складывания слов, сами буквы и существующий словарный запас ему знать не нужно»
avatar
«Там нет никаких изображений. В модели содержаться веса для нейросети. Размер типичной модели 4-8ГБ.»
Вы путаете обучение с генерацией. Да, бот сможет с высокой точностью по заложенным алгоритмам определить на фото слона от обезьяны — для этого базы хватит, но он не сможет создавать новые объекты без опоры на базу существующих. Одно дело «нарисуй табурет», другое — сложную композицию, где у «необученной» поделки или без базы будет лезть левак.
Например: попробуйте того же сберовского или яндексовского генератора заставить нарисовать обнимающихся на фоне моря бенгальскую и британскую однотонную короткошерстную кошек — они все выдают совершенно не соотвествующий результат, в лучшем случае рисуют пару полосатых рядом. И зарубежные аналогично. А ведь у них огромные базы-образцов. (Кстати, корректного решения удалось добиться только у Кадинского, да и то благодаря его функционалу доработки старых ответов вместо генерации новых)
«эти чатботы могли писать программы, статьи или разгадывать головоломки?»
Делали то, что закладывалось авторами. Да, были сильно ниже функционалом современных, но были. Если автор задал алгоритмы hello world с 20 вариантами исполнения на ассемблере — бот это выдаст, если автор вбил Большую Советскую — поможет с кроссвордом.
И, если современная облачная сможет простенький код набросать, то автономная просто пошлет лесом, если у нее не будет соответствующих баз… да даже облачные лесом посылают часто на простых задачах.
«Бред. Это самое главное что нужно — оперативка и вычислительные мощности GPU/NPU.»
Ну будет у вас экзафолпсный смартфон с террабайтом ОЗУ и что он сможет в автономном режиме без баз данных? Даже процитировать книгу или сделать что-то как в этой книге не осилит, ибо у него просто не будет о ней никакой информации. Также и нарисовать сложный объект, написать программу на япре, который в него не забит и т.д.
Современные ИИ определяет оперирование информацией! Это как топливо для авто: не важно, сколько лошадей под капотом, если бак пустой.
avatar
«наличие в смартфоне нейросети, которая будет создавать изображения непосредственно на устройство, потребует от смартфона минимум 12 ГБ ОЗУ»
А сколько внутреннего хранилища они посчитали? С учетом, что все эти условно генеративные ИИ используют базы данных уже готовых изображений. А автономные чат-боты и во времена DOS-а были на X8088 с 640кб оперативки.
Чем больше в сторону настоящего генеративного ИИ, тем серьезней объем баз для выборки (хранилище данных). Оперативная тут вторична, как и вычислительные мощности — лишь для реализации допустимой задержки ответа.
Так что их расчеты из серии исследований британских ученых.
А по факту бизнес и практика по фактическому ИИ, вроде как, идут в сторону носимых терминалов с облачными хранением и обработкой (удаленкой), нагрузку на процессор и оперативку дают лишь игры у основных частных потребителей и спец-задачи в автономной среде у корпов.
Так что смарт с 24 Гб ОЗУ выйдет не из-за ИИ, а из-за очередной требовательной игрушки с реалистичной графикой и из-за тенденций уменьшения затрат на разработку в объектно-ориентированном программировании (упрощение процесса создания до игры в тетрис — сборки своего проекта из кучи чужих библиотек с кучей ненужных, забагованных и грузящих устройство хвостов)
avatar
Если вместо батарейки за 100 баксов можно поставить батарейку за 150-200 баксов — обычно так и пишут.
А когда стоимость сильно, на порядки, превышает, получается как в новости: «Себестоимость производства литий-железо-фосфатных стартерных аккумуляторов выше, чем у свинцово-кислотных аккумуляторов, но BYD в последнее время добилась значительного снижения стоимости» — мы планируем, но запустить не можем, ибо ценник выходит неадекватный.
avatar
Речь выбор между грантой за лям с обычным аккумулятором и такой же грантой, но за 10 лямов с 10летней батарейкой.
avatar
Одно дело электромобиль, где батарейки 70-80% стоимости, другое с двс.
Возьмете Гранту за 10 лямов из-за не требующего замены 10 лет аккумулятора?
avatar
Осталось лишь уточнить: насколько эти аккумуляторы удорожат авто и в чем смысл выпускать гниющие за 5 лет машины с 10-летними аккумуляторами.
avatar
А как в 90е появлялись IT-шники на постсоветском пространстве?
Самообучение, обмен знаниями, книги...
Не путайте человека, углубленно изучающего то, что ему интересно, и применяющего навыки на практике с «планктоном», закончившим 3-месячные курсы «потому-что должны много платить и напрягаться не надо»
avatar
Специалистов хватает… Если им предлагать адекватную оплату.
Плачутся о нехватке желающие высококлассных рабов за доширак
avatar
*фильтрация конкретных VPN-сервисов и VPN-протоколов "
Если конкретные сервисы еще можно логически объяснить, например тем же перехватом и внедрением, то протоколы...
Так можно гражданам и TCP запретить, оставив только UDP с сертифицированными по таблице-шаблону пакетами.