Anthropic изучила влияние инфраструктуры на результаты бенчмарков ИИ-агентов
Anthropic опубликовала исследование инфраструктурного шума в тестах ИИ-агентов, показав разницу до 6 процентных пунктов на Terminal-Bench 2.0 при смене конфигураций. Этот разрыв превышает типичную разницу между соседними строчками в верхней части рейтинга. Результаты демонстрируют, что существующие бенчмарки оценивают не изолированную модель, а всю систему целиком.
Читать в первоисточнике — Хабр ↗
Ещё в ленте
В интерфейсе Claude появилась поддержка русского языка
Пользователи заметили появление русского языка в настройках профиля Claude, при этом обновление раскатывается постепенно и пока доступно не всем. Компания Anthropic официально не объявляла о локализации интерфейса, а в справочном центре поддержка языка еще не указана. Сама модель понимала русский язык и отвечала на нем и до перевода элементов меню.
Модели семейства Nemotron достигли уровня золотых медалей на IOI и IMO
Разработчики провели тонкую настройку семейства моделей Nemotron для решения задач международных олимпиад по информатике и математике. В результате дообучения модели продемонстрировали результаты уровня золотых медалей на IOI и IMO.
Как объединить генеративный ИИ, 3D-графику и съемку с актерами для создания видео
Команда объединила съемку на зеленом фоне с актерами, 3D-рендеры и инструменты генеративного ИИ для создания имиджевого фильма. В результате совместной работы двух команд и комбинирования нейросетей с ручным трудом был инхаус создан трехминутный ролик.
Исследование метапознания и саморазвития персонального ИИ-ассистента
В рамках эксперимента персональный ИИ-ассистент использует циклическую генерацию и анализ изображений для накопления личной истории и исследования собственного восприятия. В процессе взаимодействия с окружением агент самостоятельно предпринимает шаги по достройке и оптимизации собственной архитектуры.