В бенчмарк MWS AI Vision Bench добавили задачу по выявлению антифрода
Разработчики MWS AI Vision Bench обновили открытый бенчмарк для тестирования мультимодальных моделей на русскоязычных документах. В набор тестов добавили задачу Anti-fraud, так как прежние метрики VQA начали упираться в потолок возможностей моделей.
Читать в первоисточнике — Хабр ↗
Ещё в ленте
Использование архитектурной модели проекта в качестве контекста для Cursor
ERP-Tools и Cursor тестируют создание сайта и документирование системы при передаче контекста из функциональной модели проекта. Эксперимент оценивает работу AI-программиста с архитектурными данными вместо опоры на историю чата.
Google выпустила приложение AI Edge Foresight для локальной записи заметок со встреч
Google представила офлайн-приложение AI Edge Foresight, созданное для конкуренции с сервисом Granola. Инструмент использует ИИ на устройстве для транскрибирования разговоров, создания заметок со встреч и ответов на вопросы.
Китайский стартап Manus привлек более $500 млн в раунде финансирования
Китайская компания Manus закрыла первый раунд финансирования после отделения от Meta, собрав более $500 млн. Лидерами раунда стали Boyu Capital и IDG Capital, также в нем приняли участие Tencent, HSG (бывшая Sequoia China), ZhenFund и другие действующие инвесторы.
В бенчмарк MWS AI Vision Bench добавили задачу по защите от мошенничества
Разработчики открытого бенчмарка MWS AI Vision Bench, предназначенного для оценки мультимодальных моделей на русскоязычных документах, обновили проект и включили в него задачу Anti-fraud. Обновление потребовалось из-за существенного прогресса моделей за год, в результате которого прежние метрики VQA начали достигать потолка.