Разработан винный бенчмарк OenoBench для тестирования языковых моделей
Разработчик представил бенчмарк OenoBench, включающий 3 266 вопросов с вариантами ответов на основе 38 104 фактов о вине. Генерацию заданий, написание кода и аудит выполняли LLM-агенты, после чего на тесте проверили шестнадцать моделей. Эксперимент выявил технические сложности и ограничения LLM при создании бенчмарков, включая синхронные ошибки моделей-судей.
Читать в первоисточнике — Хабр ↗
Ещё в ленте
OpenAI уволила трех исследователей безопасности после внутренней проверки
OpenAI прекратила сотрудничество с тремя исследователями безопасности. Причиной увольнения стало внутреннее расследование, которое выявило ненадлежащее обращение с конфиденциальной информацией компании.
Выявлены характерные слова-маркеры в генерациях модели Opus 5.5
Анализ текстов модели Opus 5.5 показал наличие повторяющихся шаблонов, отличающих ее от человека. Главным маркером модели стало слово «dependable», которое встречается в ее ответах в 23 раза чаще, чем в образцах человеческой речи.
Суд США отклонил антимонопольные иски к Google из-за AI Overviews
Федеральный судья отклонил антимонопольные иски компаний Chegg и Penske Media Corporation против Google. Истцы утверждали, что поисковые функции корпорации на базе искусственного интеллекта лишают их сайты веб-трафика. Суд встал на сторону Google и отклонил претензии заявителей.
Влияние ИИ на рутинные задачи и темпы экономического прогресса
Передовой ИИ может принести наибольшую пользу при выполнении рутинных процессов, стоящих за прорывными идеями. В материале рассматривается, почему этап реализации способен определить облик будущей экономики и темпы прогресса.