· Хабр

Anthropic изучила влияние инфраструктуры на результаты бенчмарков ИИ-агентов

Anthropic опубликовала исследование инфраструктурного шума в тестах ИИ-агентов, показав разницу до 6 процентных пунктов на Terminal-Bench 2.0 при смене конфигураций. Этот разрыв превышает типичную разницу между соседними строчками в верхней части рейтинга. Результаты демонстрируют, что существующие бенчмарки оценивают не изолированную модель, а всю систему целиком.

Читать в первоисточнике — Хабр ↗

Ещё в ленте

· Хабр · Продукты · Модели

В интерфейсе Claude появилась поддержка русского языка

Пользователи заметили появление русского языка в настройках профиля Claude, при этом обновление раскатывается постепенно и пока доступно не всем. Компания Anthropic официально не объявляла о локализации интерфейса, а в справочном центре поддержка языка еще не указана. Сама модель понимала русский язык и отвечала на нем и до перевода элементов меню.

· Hugging Face · Модели · Исследования

Модели семейства Nemotron достигли уровня золотых медалей на IOI и IMO

Разработчики провели тонкую настройку семейства моделей Nemotron для решения задач международных олимпиад по информатике и математике. В результате дообучения модели продемонстрировали результаты уровня золотых медалей на IOI и IMO.

· Хабр · Бизнес · Продукты

Как объединить генеративный ИИ, 3D-графику и съемку с актерами для создания видео

Команда объединила съемку на зеленом фоне с актерами, 3D-рендеры и инструменты генеративного ИИ для создания имиджевого фильма. В результате совместной работы двух команд и комбинирования нейросетей с ручным трудом был инхаус создан трехминутный ролик.

· Хабр · Исследования

Исследование метапознания и саморазвития персонального ИИ-ассистента

В рамках эксперимента персональный ИИ-ассистент использует циклическую генерацию и анализ изображений для накопления личной истории и исследования собственного восприятия. В процессе взаимодействия с окружением агент самостоятельно предпринимает шаги по достройке и оптимизации собственной архитектуры.