Причины уязвимости языковых моделей к джейлбрейк-атакам и обходу ограничений
Материал рассматривает механизмы, позволяющие пользователям обходить встроенные правила безопасности языковых моделей с помощью ролевых запросов и изменения контекста. Автор анализирует, опирается ли ИИ на поверхностные шаблоны отказов или способен концептуально распознавать запрещенные темы. Понимание природы джейлбрейков необходимо для поиска способов устранения подобных уязвимостей.
Читать в первоисточнике — Хабр ↗
Ещё в ленте
Shopify представила конструктор Canvas для создания онлайн-магазинов с помощью ИИ
Shopify представила новый конструктор сайтов Canvas. Инструмент позволяет продавцам создавать и настраивать интернет-магазины через диалог с ИИ-агентом Sidekick. Все вносимые изменения отображаются в режиме реального времени.
ИИ научился играть в Stratego благодаря дополнительной нейросети
Настольная игра Stratego с закрытой информацией долгое время оставалась сложной задачей для искусственного интеллекта. Разработчикам удалось преодолеть эту трудность с помощью добавления второй нейросети, которая предсказывает скрытые фигуры соперника.
Albertsons использует ChatGPT Enterprise и OpenAI API для оптимизации работы
Компания Albertsons Cos. внедрила ChatGPT Enterprise и OpenAI API в свои процессы. Технологии используются для ускорения работы внутренних команд и упрощения процесса покупки продуктов для миллионов покупателей.
Кнопочный телефон 1980-х годов подключили к Claude через ESP32 и Raspberry Pi
Разработчик интегрировал аудиоплату на базе ESP32 в старый немецкий кнопочный телефон FeTAp и подключил его к Raspberry Pi. Система позволяет общаться с языковой моделью Claude голосовым способом прямо при снятии телефонной трубки.