Инференс

Втрое дешевле топовых конкурентов: опубликованы веса китайской модели Kimi K3 с 2,8 трлн параметров
Moonshot AI выложила полную архитектуру модели в открытый репозиторий. Австралийский бизнес уже перебрасывает на неё до четверти трафика

Один GPU вместо нескольких: система VKAE ускорила инференс ИИ до 23 раз без расширения «железа»
Система показала многократный рост производительности на Nvidia B200 и позволила воспроизвести результаты через готовый контейнер

OpenAI удалось более чем вдвое снизить стоимость работы ИИ без новых чипов
Программная оптимизация сократила потребность ChatGPT в графических процессорах Nvidia до нескольких сотен для части пользовательского трафика

Groq привлёк $650 млн после сделки с Nvidia и потери ключевых топ-менеджеров: чип-стартап перестраивает бизнес на фоне обостряющейся борьбы за инфраструктуру инференса
Компания, чья интеллектуальная собственность частично перешла к Nvidia в рамках лицензирования и кадрового «не-поглощения», делает ставку на новое финансирование