Как тестировать и выбирать LLM под прикладные рабочие задачи
Руководитель проектов по внедрению систем на базе ИИ описал подход к тестированию языковых моделей на реальных рабочих задачах. Автор отмечает, что публичных бенчмарков недостаточно, поэтому для оценки работы с кодом и сложными документами необходимы собственные критерии приёмки.
Читать в первоисточнике — Хабр ↗
Ещё в ленте
Эвотор оснастил терминал EvoPoint нейросетью для распознавания заказов по голосу
Компания Эвотор разработала платежный терминал EvoPoint с голосовым интерфейсом на базе нейросети. Решение предназначено для распознавания команд и заказов клиентов в условиях сильного шума кофемашин и торгового зала. Технология направлена на изменение процесса покупки и взаимодействия с устройством.
Проблема согласованных ошибок в коде и тестах от ИИ-агентов
При генерации кода и тестов ИИ-агент может перенести одинаковые ошибки в обе части, из-за чего некорректный патч успешно проходит проверки. Непонимание исходных требований сохраняется на всех этапах работы модели. Впоследствии это усложняет отладку, так как исправление реализации приводит к падению зависимых тестов.
Опыт автоматизации проверки товаров с помощью Jev вместо стандартных LLM
Интернет-магазин компьютерной техники использовал решение Jev для автоматической проверки новых товаров. Это позволило устранить бэклог из 100 тысяч заявок и сократить бюджетные расходы на 90% по сравнению со стандартными LLM.
Разбор модели Jev: что известно о новой ИИ-системе
В материале рассматривается модель Jev, вызвавшая активные обсуждения в сообществе специалистов по ИИ. Автор разбирает возможности новой системы, решаемые ею задачи и основания для перевода рабочих процессов на это решение.