· Хабр

Разработан винный бенчмарк OenoBench для тестирования языковых моделей

Разработчик представил бенчмарк OenoBench, включающий 3 266 вопросов с вариантами ответов на основе 38 104 фактов о вине. Генерацию заданий, написание кода и аудит выполняли LLM-агенты, после чего на тесте проверили шестнадцать моделей. Эксперимент выявил технические сложности и ограничения LLM при создании бенчмарков, включая синхронные ошибки моделей-судей.

Читать в первоисточнике — Хабр ↗

Ещё в ленте

· TechCrunch · Безопасность · Бизнес

OpenAI уволила трех исследователей безопасности после внутренней проверки

OpenAI прекратила сотрудничество с тремя исследователями безопасности. Причиной увольнения стало внутреннее расследование, которое выявило ненадлежащее обращение с конфиденциальной информацией компании.

· TechCrunch · Модели · Исследования

Выявлены характерные слова-маркеры в генерациях модели Opus 5.5

Анализ текстов модели Opus 5.5 показал наличие повторяющихся шаблонов, отличающих ее от человека. Главным маркером модели стало слово «dependable», которое встречается в ее ответах в 23 раза чаще, чем в образцах человеческой речи.

· The Verge · Регулирование · Бизнес

Суд США отклонил антимонопольные иски к Google из-за AI Overviews

Федеральный судья отклонил антимонопольные иски компаний Chegg и Penske Media Corporation против Google. Истцы утверждали, что поисковые функции корпорации на базе искусственного интеллекта лишают их сайты веб-трафика. Суд встал на сторону Google и отклонил претензии заявителей.

Влияние ИИ на рутинные задачи и темпы экономического прогресса

Передовой ИИ может принести наибольшую пользу при выполнении рутинных процессов, стоящих за прорывными идеями. В материале рассматривается, почему этап реализации способен определить облик будущей экономики и темпы прогресса.