Anthropic оценила возможности моделей в задачах бинарной эксплуатации
Команда Anthropic Frontier Red Team протестировала ИИ-модели на 100 задачах бенчмарка бинарной эксплуатации. Модели Claude Mythos Preview и GLM-5.3 успешно осуществили захват потока управления в 6% и 4% тестов соответственно. Для сравнения, предыдущие поколения моделей вроде Claude Opus 4.6 и GLM-5.2 не справились ни с одной из этих задач.
Читать в первоисточнике — Simon Willison ↗
Ещё в ленте
OpenAI пресекла скоординированную кампанию по дистилляции моделей
OpenAI остановила масштабную кампанию, целью которой было извлечение защищенных цепочек рассуждений из ее моделей. В ответ на инцидент компания усиливает меры защиты от подобных враждебных попыток дистилляции.
OpenAI обучит малый бизнес работе с искусственным интеллектом совместно с Americas SBDC
OpenAI объявила о партнерстве с America’s SBDC для расширения программ практического обучения и локальной поддержки малого бизнеса в сфере искусственного интеллекта. Также компания представила новый отчет об использовании AI-инструментов небольшими командами.
Hugging Face запустила Open TTS Leaderboard для оценки моделей синтеза речи
Hugging Face представила открытый лидерборд Open TTS Leaderboard. Он предназначен для масштабируемой оценки и сравнения многоязычных моделей синтеза речи (Text-to-Speech) и алгоритмов клонирования голоса.
Протестующие против OpenAI представили скульптуру с лидерами ИИ на тонущем корабле
Протесты против компании OpenAI принимают все более творческие формы. В рамках одной из акций была создана новая скульптура, изображающая лидеров индустрии ИИ, которые спасаются с тонущего корабля.