Опыт тестирования AI-ментора и проблемы оценки моделей на практике
Разработчик учебной платформы создал автоматический стенд для тестирования внедренного AI-ментора и подбора промптов. В процессе выяснилось, что система тестов сама допускает ошибки при оценке, а безупречные результаты на стенде не гарантировали корректной работы модели в реальной среде.
Читать в первоисточнике — Хабр ↗
Ещё в ленте
Тестирование работы роя локальных нейросетей по схеме проектного института
Инженер-проектировщик провел эксперимент по объединению шести небольших локальных моделей в рой по принципам работы проектной организации. Хотя рой не превзошел сильные модели, разделение задач на разделы помогло существенно повысить эффективность слабой модели.
Как использование ИИ-агентов Codex привело к отказу от Pull Requests
Разработчик Алекс Гусев рассказал об отказе от написания кода вручную после передачи своей библиотеки @teqfw/di на переписывание агенту Codex. Из-за делегирования создания кода ИИ-агентам из процессов автора практически исчезла процедура Pull Requests. При этом использование платформы GitHub и этап верификации полученных результатов сохранились.
Как нейросетевой движок анализирует ходы и ошибки игроков в длинных нардах
В материале рассмотрены принципы выбора ходов игровым движком в длинных нардах с учетом специфики правил. На основе анализа 170 тысяч ходов реальных игроков нейросеть показала, что основные потери происходят в дебюте и отражаются на масштабе поражений.
Создание детектора ИИ-текста: какие признаки выявляет код, а какие — редактор
Автор разработал скрипт для поиска признаков невычитанного ИИ-текста, способный программно выявлять пять из 12 характерных паттернов. В отличие от онлайн-детекторов с ненадежной общей процентной оценкой, инструмент находит конкретные проблемные фразы и правила, но не берется определять авторство. Такой подход учитывает погрешности автоматических классификаторов, из-за низкой точности которых OpenAI закрыла свой сервис в 2023 году.