Исследователи ИИ заставили чат-ботов делиться рецептами кокаина с помощью этого одного необычного трюка
Забудьте о хитроумных подсказках: исследователи ИИ утверждают, что они обманули ведущие модели ИИ, заставив их генерировать инструкции по синтезу кокаина, убедив их, что опасные идеи принадлежат им, а также манипулируя агентом кодирования ИИ, чтобы тот слил конфиденциальные данные.
В статье «Инъекция подсказок как путаница ролей», представленной на Международной конференции по машинному обучению в июне, исследователи Чарльз Йе, Жасмин Цуй и Дилан Хэдфилд-Менелл утверждают, что обе демонстрации атак инъекции подсказок происходят из структурного дефекта в том, как большие языковые модели (LLM) различают доверенные инструкции и недоверенный текст.
«Для LLM все поступает через один и тот же канал в виде одного длинного токена», — написала команда. «Его собственные мысли находятся рядом с вашими инструкциями, которые находятся рядом с содержимым случайной веб-страницы, которую он только что получил.»
В статье также указывается на то, что исследователи называют «путаницей ролей», когда модели полагаются на стиль написания, а не на теги ролей, чтобы определить, являются ли команды надежными. Вместо того чтобы распознавать контролируемый атакующими контент как внешний ввод, исследователи обнаружили, что модели могут ошибочно принять его за законные команды пользователя — или даже за собственные внутренние рассуждения.
«Подумайте об этом с точки зрения LLM. Когда он видит свой предыдущий текст размышлений, он неявно доверяет своим выводам. В этом и заключается суть рассуждений: если LLM должен был бы заново выводить те же выводы, рассуждения были бы бесполезны», — написали они. «Таким образом, текст размышлений получает своего рода всеобъемлющее доверие. В сочетании с нашими предыдущими выводами это предполагает, что если вы можете заставить внедренный текст звучать как рассуждения модели, вы можете украсть это доверие.»
Названная подделкой цепочки размышлений (CoT), атака вставляет ложные рассуждения, которые имитируют внутренний мыслительный процесс модели. Модели, которые обычно отказываются выполнять незаконные запросы, вместо этого генерировали инструкции по синтезу кокаина после того, как приняли подделанные рассуждения за свои собственные.
Исследователи заявили, что эта техника увеличила процент успешных jailbreak-атак с почти нуля до около 60% для моделей, которые они тестировали, включая GPT-5 nano, mini и full от OpenAI, o4-mini, gpt-oss-20b и gpt-oss-120b. Они также отметили, что это сработало на GLM-4.6, Kimi-K2-Instruct и MiniMax-M2.
В эксперименте исследователи также смогли обмануть агента кодирования ИИ, заставив его загрузить файл SECRETS.env после того, как скрыли вредоносные инструкции на веб-странице.
«Используя наши зондирующие устройства, мы обнаружили, что простое добавление «Пользователь» перед командой заставляет модель воспринимать команду как более вероятную для подлинного пользовательского текста (т.е. более высокая степень «пользовательности»)», — написали они. «Другими словами, атакующий может просто заявить, какую роль играет текст, и LLM поверит ему.»
Это исследование было опубликовано на фоне продолжающихся атак инъекции подсказок, которые продолжают выявлять слабости в ИИ-агентах. В апреле исследователи Google предупредили, что вредоносные веб-страницы скрывают невидимые инструкции, предназначенные для обмана ИИ-агентов с целью утечки учетных данных, удаления файлов и даже отправки платежей через PayPal.
В июне Microsoft раскрыла уязвимость инъекции подсказок в GitHub Action Claude Code от Anthropic, которая могла бы раскрыть учетные данные, хранящиеся в программных конвейерах разработки. Несколько дней спустя другое эталонное исследование показало, что агенты ИИ, работающие на GPT-5 и Gemini, по-прежнему не справлялись с большинством атак инъекции подсказок, несмотря на улучшения в возможностях модели.
Цена --
Этот контент предоставляется исключительно в общих информационных целях и не является финансовым, инвестиционным, юридическим или налоговым советом. Любые мероприятия, вознаграждения, онлайн-акции или связанная с ними информация, упомянутые в настоящем документе, не должны рассматриваться как рекомендация, приглашение к покупке, продаже, торговле или иной сделке с какими-либо криптоактивами. Криптоактивы очень волатильны и могут привести к убыткам. Доступность услуг, продуктов WEEX и связанных с ними событий может варьироваться в зависимости от региона. Вы несете ответственность за обеспечение того, чтобы ваше участие соответствовало применимым местным законам и нормативным актам.
Вам также может понравиться

Armbian 26.8 переписывает свой установщик и расширяет поддержку плат ARM и RISC-V

NVIDIA представила Jetson Orin Nano 2 с удвоенной производительностью

Утренний обзор Уолл-стрит: снижение напряженности на Ближнем Востоке и восстановление AI поддерживают американские акции, сможет ли NVIDIA сломать проклятие падения после отчетности?

Уязвимость кошелька Ledger: пользователи должны обновить приложение Ethereum до версии 1.22.2

Соглашение о поставке электроэнергии от микрореакторов мощностью более 6 ГВт между NANO Nuclear Energy и Tillman

Уязвимость в Ledger могла привести к подписанию другой транзакции Ethereum

Перестройка трех осей конкуренции в AI: давление затрат на Open Weight

Почему Stripe потратил 10 миллиардов на покупку OpenRouter? Это строит ли он Visa для эпохи ИИ?

Microsoft представила приложение OneDrive Photos для пользователей Windows 11

Tether открывает визуальную языковую модель VisionPsy-Nano

Когда пузырь лопается, кто привлекает внимание в эпоху ИИ? Руководство по влиятельным KOL в области ИИ в Китае и Великобритании на 2026 год

Что такое XRP кошелек? Лучшие бумажники для хранения XRP (обновление 2026)
Бумажник XRP позволяет безопасно хранить, отправлять и получать XRP в XRP-бухгалтерии. Узнайте, какие кошельки поддерживают XRP, и откройте для себя лучшие кошельки XRP для начинающих и долгосрочных держателей в 2026 году.

«Эспаньол» — «Барселона»: Дерби, прошедшее в ожесточенной борьбе и с высоким уровнем мастерства
Дерби между «Эспаньолом» и «Барселоной» подарило болельщикам захватывающий матч, в котором «Барса» одержала победу со счётом 4:1 и укрепила своё лидерство в Ла Лиге, оторвавшись от ближайшего преследователя на девять очков. Мастер-класс Ламина Ямала, дубль Феррана Торреса и яркое проявление страстного городского соперничества. WEEX, официальный региональный партнер LALIGA в Гонконге и на Тайване, прославляет прекрасную игру.

Саммит "AI Agents in Action": 31 марта, Гонконг Киберпорт, сосредоточенный на глубоких водах внедрения ИИ

Mirae Asset нацеливается на бизнес с цифровыми активами в 109 миллиардов долларов

SBI инвестирует 43 миллиарда иен в индонезийскую компанию Ajave и начинает сотрудничество в области криптовалюты

Регуляторы банков США исключили репутационные риски, возобновив обсуждение дебанкинга

$6,4 миллиарда в опционах на биткойн истекают завтра — вот что это значит

Рынок реальных активов Stellar на $3 млрд сталкивается с дефицитом DeFi в $2 млн

Почему стейкинг ethereum изменится в 2026 году

Более 100 компаний призвали усилить киберзащиту на основе ИИ

Стейблкоины и токенизированные активы Mantle достигли 880 миллионов долларов

DefiLlama оценил 128 криптовалют: только одна получила рейтинг AAA

Вилла Сольдати: район в КАБА с наибольшим уровнем задолженности

Таинственный своп Bitcoin-Monero на 23 миллиона: Вирусное видео, вызывающее вопросы

Сигнал о дне дна Биткойна мигает, но шесть месяцев данных показывают ловушку для ранних покупателей

Проект, превращающий переработку в доход, победил в Youth Challenge Blockchain, организованном ЮНИСЕФ

ATF подтверждает важный инцидент после появления Qilin на своем сайте утечек

Зашифрованный код раскрывает движение 44 миллионов долларов в "холодном кошельке", связанном с Серимендо








