Создан русскоязычный бенчмарк для Decision Models
Разработан русскоязычный бенчмарк для тестирования специализированных моделей принятия решений (Decision Models). Тест оценивает качество, скорость и стоимость как облачных, так и локальных решений, включая TypeSafe Jev, Cloudflare Clef и модели от OpenAI.
Читать в первоисточнике — Хабр ↗
Ещё в ленте
Nvidia делает ставку на physical AI для безопасности роботакси и роботов
Nvidia развивает технологии physical AI, нацеленные на повышение безопасности роботакси и роботов-гуманоидов. Полностековое решение безопасности от компании уже начали применять робототехнические предприятия.
Сканер уязвимостей для кода от ИИ протестировали на 3800 публичных репозиториях
Разработчик создал SAST-сканер для анализа кода, сгенерированного искусственным интеллектом, и проверил с его помощью 3 800 публичных репозиториев. Из 16 378 первоначальных срабатываний подтвердилось около 30 реальных утечек конфиденциальных данных.
Опыт EXANTE: создание и внедрение мультиагентного AI-разработчика Codey
Компания EXANTE поделилась опытом создания мультиагентной AI-системы Codey, которая ведет задачи от Jira до готовых фич. В компании отметили, что одной сильной модели недостаточно для эффективной автоматизации разработки. Для успешного внедрения требуются четкие требования, подготовленная кодовая база и система измеримых проверок.
Сравнение моделей генерации изображений Google Nano Banana 2.1 и Nano Banana 2
Google выпустила обновленную модель Nano Banana 2.1, заявив об улучшении качества, рендеринга текста и консистентности персонажей. Первичное пользовательское тестирование на одинаковых промптах показало расхождения с обещаниями компании, при этом независимых масштабных бенчмарков релиза пока нет.