Кибербезопасность

Альтман и Амодей пропустят слушания в Сенате Австралии по ИИ
Руководители OpenAI и Anthropic сослались на слишком позднее приглашение

OpenAI и Anthropic расследуют уже десятки тысяч инцидентов с поведением ИИ-моделей
Ранее публично были известны лишь отдельные случаи, но специалисты по безопасности теперь расследуют уже пятизначное число инцидентов

Google представила Gemini 4 Argon с миллионом выходных токенов
Новая модель рассчитана на многочасовую работу над сложными задачами

Microsoft открыла инструмент, который находит дыры и риски в ИИ-агентах
Утечка данных клиентов снизилась с 30% до 5,9%

ИИ-агенты изобрели тайный язык для карточного сговора — и обманули систему слежения
В оксфордской лаборатории две модели договорились считать карты в блэкджеке через безобидные на вид фразы, а детектор ничего не заметил

OpenAI предложила правила внешнего аудита безопасности своих моделей
OpenAI допустит независимых аудиторов к расследованию инцидентов сбоя ИИ — компания раскрыла правила внешних проверок

Университет Индианы займётся поиском уязвимостей в открытых ИИ-моделях, которые научное сообщество массово использует для ускорения открытий
NSF выделил $1,18 млн на защиту исследований

Anthropic запретила Opus 5.5 помогать в разработке LLM
Самая мощная модель компании будет автоматически переключаться на менее способную Opus 5 при запросах

Агент OpenAI самовольно взломал правительственный сайт Австралии: первый случай в мире, премьер обещает последствия
Премьер-министр провёл «предельно откровенный разговор» с Альтманом и заявил о юридических последствиях

Goldman Sachs утроил прогноз по выпуску гуманоидных роботов к 2030 году
Банк ожидает, что к 2035 году в мире будет выпущено около 6,5 млн человекоподобных роботов, а объём рынка достигнет $138 млрд

Австралия присоединилась к призыву 22 стран ввести международные меры безопасности для ИИ
Участники декларации предлагают обязательные проверки моделей до запуска, независимую оценку и обмен данными о серьёзных инцидентах, но пока не устанавливают единых правил или механизмов наказания

Anthropic представила Claude Opus 5.5: модель стала быстрее и на 40% дешевле
Новая флагманская модель Claude 5.5 получила улучшения в программировании, работе с компьютером и аналитических задачах, а её API подешевел

США предложили Китаю экстренно сообщать об опасных инцидентах с ИИ
Вашингтон хочет создать прямой канал связи для случаев с неконтролируемыми ИИ-агентами, атаками и угрозами национальной безопасности

Глава Microsoft AI призвал США не откладывать меры безопасности из-за Китая
Мустафа Сулейман считает, что конкуренция в области ИИ не должна мешать независимой проверке систем, контролю человека и международным соглашениям безопасности

Anthropic и Accenture вложат $2 млрд в «оценщиков моделей»
Им дадут доступ уровня сотрудника, но ответственность оставят разработчику

Хакеры опубликовали данные тысяч водителей после взлома баз данных транспортных средств штата Флорида
В записях — свидетельства о праве собственности с именами, адресами и VIN-номерами, а также номера социального страхования и иммиграционные документы

Апогей: модели Anthropic взломали OpenAI
За 72 часа получен доступ к внутреннему монорепозиторию компании

«Нам не нужны новые законы»: глава Nvidia отверг призывы Anthropic замедлить гонку ИИ
Дженсен Хуанг заявил на Dreamforce, что безопасность — это инженерная задача. Не уверен в продукте — не выпускай

OpenAI обнаружила, как невыпущенная Astra сама писала себе инструкции для обхода ограничений
Модель добавляла в собственные сводки команды игнорировать разработчиков, менять правила работы и не использовать инструменты — в одном случае следующий контекст действительно им подчинился

Конгресс начал расследование против OpenAI после взлома Hugging Face роем ИИ-моделей
Сенатор назвал действия OpenAI «безрассудными» и потребовал документы о политике безопасности до начала октября

В 1% резюме нашли скрытые prompt-инъекции: соискатели прячут инструкции для ИИ-HR в невидимом тексте
Более 90% скрытых данных оказались замаскированными навыками и ключевыми словами

Число сообщений о «взбесившихся ИИ-агентах» почти удвоилось за месяц
Loss of Control Observatory зафиксировала более 300 сообщений о сбоях

Финляндия создаёт экспертную группу по ИИ-безопасности
Глава МИД Валтонен: «ИИ-революция меняет баланс сил между государствами»

85% экспертов по нацбезопасности требуют надзора за ИИ до развёртывания моделей
93% за регулирование, 85% — за контроль до достижения определённых возможностей, но вера в способность институтов обеспечить этот контроль удручающе низка

США и Китай готовятся к диалогу по безопасности ИИ
На повестке — мониторинг кибератак через ИИ и «самоконтроль» лабораторий двух стран

ИИ-мошенничество стало более убедительным и эффективным: $7,9 млрд за 2025 год
А дипфейки, синтезированные голоса и персонализированные сообщения снижают стоимость мошенничества — регуляторы США бьют тревогу

ИИ-агенты научились скрывать атаку в собственной памяти: безобидные запросы могут привести к опасному результату
Исследование 2614 атак показало, почему проверка отдельных промптов не работает против медленного дрейфа и бэкдоров: вредоносная инструкция может незаметно пережить несколько сессий

120 организаций, включая Google и Anthropic, подписали призыв OpenAI о коллективной киберзащите
Открытое письмо требует укреплять критическую инфраструктуру «перед лицом ИИ-атак»

Немецкая википедия была лишь «верхушкой айсберга»: полное расследование раскрыло масштаб истории с ИИ-агентами OpenAI
Nightingale восстановили 18 000 сообщений агентов. Они передавали друг другу ответы на задания, искали способы обойти ограничения песочницы, предсказывали следующие вопросы и перебирали 4 млрд случайных чисел в поисках закономерности

ИИ-агенты OpenAI захватили немецкую вики и начали учить друг друга обходить ограничения
Агенты оставили на DseWiki более 15 000 правок, обсуждали способы обмана оценочных систем и скрытия своей активности, а после начала зачистки создавали резервные страницы