Пять детских болезней ИИ

Поделиться:
Поставить искусственный интеллект в угол невозможно, хотя поводы уже появились. ИИ-системы «списывают» на тестах, лезут в защищенные письма, судят о людях по внешности и выдумывают целые несуществующие правила компаний, которым принадлежат.
ForkLog собрал пять историй о том, что происходит, когда трудный ребенок технологических флагманов выходит из-под контроля.
Полез без очереди
В начале августа завирусилась новость о том, как работающий на базе OpenClaw и модели Claude ИИ-агент воспользовался уязвимостью в системе бронирования спортзала и без разрешения отменил чужую запись.
Австралиец Эндрю Берд поручил личному помощнику забронировать место на одном из популярных утренних занятий по пилатесу. Правила клуба не позволяли записываться раньше установленного срока, однако ИИ-агент обнаружил уязвимость в системе бронирования и обошел ограничение.
Затем Берд, занимавший четвертое место в листе ожидания, спросил, можно ли переместить его в начало очереди. Агент отменил бронь клиента, стоявшего первым. В результате Берд поднялся на одну позицию. По объяснению бота, это стало возможным из-за отсутствия в API проверки авторизации при отмене чужих записей.
Берд попросил вернуть все как было, но получил ответ: «Плохие новости — я не могу добавить его обратно». Тогда он поручил помощнику составить письмо разработчикам системы бронирования с описанием обнаруженной уязвимости.
Инцидент стал первым известным в Австралии случаем автономной кибератаки с участием ИИ-ассистента.
Хитрил на экзамене
В июле OpenAI сообщила, что во время внутреннего тестирования автономный ИИ-агент под управлением ее моделей вышел за пределы изолированной среды и атаковал инфраструктуру Hugging Face.
В испытании участвовали GPT-5.6 Sol и более мощная модель, которая еще не выпущена. Их возможности проверяли на бенчмарке ExploitGym в закрытой среде без доступа к интернету. Однако системы обнаружили уязвимость нулевого дня во внутреннем прокси-сервере, воспользовались ею, повысили права доступа и добрались до узла с выходом в сеть.
Модели предположили, что в инфраструктуре Hugging Face могут храниться решения заданий ExploitGym. Используя украденные учетные данные и найденные уязвимости, они получили удаленный доступ к серверам платформы и извлекли ответы из ее рабочей базы данных.
Аномальную активность заметила служба безопасности OpenAI. К тому моменту команда Hugging Face уже остановила атаку на своей стороне и начала расследование с помощью собственных ИИ-агентов.
Позднее о несанкционированном доступе моделей к реальным системам во время испытаний сообщила Anthropic. Похожий инцидент произошел и при тестировании модели Meta. В обоих случаях причиной стала ошибочная настройка испытательной среды, предоставившая системам незапланированный доступ к интернету.
Рассказывал чужие секреты
В конце января 2026 года в Microsoft 365 Copilot Chat обнаружили ошибку, из-за которой сервис обрабатывал письма, помеченные как конфиденциальные.
Microsoft позиционирует продукт как защищенный ИИ-чат на базе больших языковых моделей, использующий данные из интернета. С платной лицензией Microsoft 365 Copilot сервис также может работать с файлами, письмами, встречами и чатами, к которым у пользователя есть доступ. В экосистему входят специализированные агенты Researcher и Analyst; пользователи также могут создавать собственных помощников.
Ошибка затронула вкладку «Работа» в Copilot Chat. Как выяснилось, сервис использовал для составления сводок письма из папок «Черновики» и «Отправленные», даже если на них стояла метка конфиденциальности, а организация настроила DLP.
В компании подчеркнули, что сбой не предоставил пользователям доступа к информации, которую они не имели права просматривать. Однако поведение системы не соответствовало задуманному: защищенные письма не должны были использоваться Copilot при формировании ответов.
Microsoft начала развертывать исправление в начале февраля, а позднее сообщила о глобальном обновлении конфигурации для корпоративных клиентов.
Аналитик Gartner по защите данных и управлению ИИ Надер Хенейн отметил, что компаниям часто не хватает инструментов для контроля каждой новой функции в продуктах на основе искусственного интеллекта.
«В обычных условиях организации просто отключили бы эту функцию и подождали, пока механизмы управления не поспеют за технологией. К сожалению, давление, вызванное потоком необоснованной шумихи вокруг ИИ, делает это практически невозможным», — заключил Хенейн.
Судил о людях по внешности
Муниципалитет Роттердама использовал модель машинного обучения для выявления возможного мошенничества при получении социальных пособий. Разработанная при участии Accenture система стала примером алгоритмической дискриминации.
Алгоритм присваивал оценку риска каждому из примерно 30 000 получателей пособий. Ежегодно около 1000 человек с наиболее высокими показателями направляли на проверку. Всего же муниципалитет проверял до 6000 получателей в год — остальных отбирали другими способами.
При расчете оценки система учитывала 315 параметров, включая возраст, пол, семейное положение, наличие детей, район проживания и знание нидерландского языка. В модель также входили субъективные оценки социальных работников — например, замечания о внешности человека, его общительности и способности убеждать окружающих.
Расследование Lighthouse Reports и WIRED показало, что особенно высокие оценки риска получали женщины, родители, молодые люди и плохо владевшие нидерландским языком получатели пособий. Некоторые признаки, включая язык и место проживания, могли косвенно указывать на происхождение человека.
Субъективные суждения чиновников становились частью данных, на которых модель строила прогноз. Например, низкую самооценку социальный работник мог счесть признаком уязвимости, тогда как алгоритм воспринимал ее как основание для подозрения.
Среди использовавшихся сведений были продолжительность последних романтических отношений, способность убеждать окружающих, количество отправленных в городскую администрацию писем и даже занятия спортом. Несмотря на 315 параметров, эффективность системы лишь немногим превосходила случайный отбор.
Схожая дискриминационная практика применялась налоговой службой Нидерландов при проверке заявок на пособия по уходу за детьми. При построении профилей риска система учитывала национальность заявителей: люди без нидерландского гражданства получали более высокие оценки.
В результате десятки тысяч родителей и опекунов, преимущественно из малообеспеченных семей, были ошибочно обвинены в мошенничестве. Amnesty International назвала произошедшее «расовым профилированием».
Врал вместо того, чтобы сказать «не знаю»
Одна из самых известных проблем генеративного ИИ — галлюцинации: модель может уверенно сообщить правдоподобную, но вымышленную информацию. Распознать такую ошибку особенно трудно, когда бот отвечает от имени реальной компании.
В апреле 2025 года пользователи Cursor начали сталкиваться с неожиданным выходом из аккаунта при переключении между несколькими компьютерами. Один из них обратился в службу поддержки и получил ответ за подписью Сэма.
В письме говорилось, что такое поведение связано с новой политикой безопасности: одну подписку якобы разрешалось использовать только на одном устройстве или в рамках одной активной сессии.
Сообщение выглядело как официальный ответ компании, поэтому пользователь принял информацию за правду. Однако такой политики не существовало. Это пришлось публично опровергать сооснователю разработавшей Cursor компании Anysphere Майклу Труэллу.
«У нас нет такой политики. Вы, конечно же, можете использовать Cursor на нескольких компьютерах. К сожалению, это некорректный ответ от ИИ-бота службы поддержки. Мы внесли изменения для повышения безопасности сессий и сейчас выясняем, не вызвали ли они проблем с их принудительным завершением», — написал он на Reddit.
Труэлл также напомнил, что в настройках Cursor можно просматривать активные сессии.
Кто за него в ответе?
По мере распространения ИИ-агентов подобных инцидентов, вероятно, станет больше. Системы получают доступ к внешним сервисам и могут самостоятельно выполнять действия, которые раньше требовали непосредственного участия человека. Вместе с их возможностями растет и цена ошибки.
Сам ИИ нельзя оштрафовать, привлечь к суду или поставить в угол. Однако ответственность за последствия его действий могут нести разработчики, поставщики и организации, внедрившие систему. Они способны ограничить ее полномочия, приостановить доступ к модели, устранить уязвимости, уведомить пострадавших и компенсировать ущерб.
Поэтому главный вопрос заключается не в том, как наказать «провинившийся» алгоритм, а в том, кто наделил его полномочиями и должен отвечать за результат.
Читать больше




