Сравнение навыков для Claude Code с плацебо: эффективными оказались только два
Разработчик провел 450 тестов на бенчмарках SWE-bench и Terminal-Bench, сравнив девять популярных навыков для Claude Code с нейтральным текстом той же длины и работой без инструкций. Только два скилла показали результаты лучше контрольной пустышки, популярный superpowers не показал отличий, а один навык ухудшил результат. Кроме того, ни один из вариантов не сделал выполнение задач дешевле из-за расхода контекста на хранение скилла.
Читать в первоисточнике — Хабр ↗
Ещё в ленте
Опыт EXANTE: создание и внедрение мультиагентного AI-разработчика Codey
Компания EXANTE поделилась опытом создания мультиагентной AI-системы Codey, которая ведет задачи от Jira до готовых фич. В компании отметили, что одной сильной модели недостаточно для эффективной автоматизации разработки. Для успешного внедрения требуются четкие требования, подготовленная кодовая база и система измеримых проверок.
Создан русскоязычный бенчмарк для Decision Models
Разработан русскоязычный бенчмарк для тестирования специализированных моделей принятия решений (Decision Models). Тест оценивает качество, скорость и стоимость как облачных, так и локальных решений, включая TypeSafe Jev, Cloudflare Clef и модели от OpenAI.
Сравнение моделей генерации изображений Google Nano Banana 2.1 и Nano Banana 2
Google выпустила обновленную модель Nano Banana 2.1, заявив об улучшении качества, рендеринга текста и консистентности персонажей. Первичное пользовательское тестирование на одинаковых промптах показало расхождения с обещаниями компании, при этом независимых масштабных бенчмарков релиза пока нет.
Хеширование состава выборки для корректного отслеживания метрик ML-экспериментов
При оценке моделей стандартного сохранения версий данных и алгоритмов может быть недостаточно из-за неконтролируемого изменения состава выборки со временем. В материале рассматривается практика хеширования фактического набора объектов вместо текста правил отбора для фиксации контекста метрик. Также анализируются ограничения такого подхода при проведении экспериментов.