· Хабр

Опыт тестирования AI-ментора и проблемы оценки моделей на практике

Разработчик учебной платформы создал автоматический стенд для тестирования внедренного AI-ментора и подбора промптов. В процессе выяснилось, что система тестов сама допускает ошибки при оценке, а безупречные результаты на стенде не гарантировали корректной работы модели в реальной среде.

Читать в первоисточнике — Хабр ↗

Ещё в ленте

· Хабр · Модели · Исследования

Тестирование работы роя локальных нейросетей по схеме проектного института

Инженер-проектировщик провел эксперимент по объединению шести небольших локальных моделей в рой по принципам работы проектной организации. Хотя рой не превзошел сильные модели, разделение задач на разделы помогло существенно повысить эффективность слабой модели.

· Хабр · Продукты

Как использование ИИ-агентов Codex привело к отказу от Pull Requests

Разработчик Алекс Гусев рассказал об отказе от написания кода вручную после передачи своей библиотеки @teqfw/di на переписывание агенту Codex. Из-за делегирования создания кода ИИ-агентам из процессов автора практически исчезла процедура Pull Requests. При этом использование платформы GitHub и этап верификации полученных результатов сохранились.

· Хабр · Исследования · Модели

Как нейросетевой движок анализирует ходы и ошибки игроков в длинных нардах

В материале рассмотрены принципы выбора ходов игровым движком в длинных нардах с учетом специфики правил. На основе анализа 170 тысяч ходов реальных игроков нейросеть показала, что основные потери происходят в дебюте и отражаются на масштабе поражений.

· Хабр · Исследования

Создание детектора ИИ-текста: какие признаки выявляет код, а какие — редактор

Автор разработал скрипт для поиска признаков невычитанного ИИ-текста, способный программно выявлять пять из 12 характерных паттернов. В отличие от онлайн-детекторов с ненадежной общей процентной оценкой, инструмент находит конкретные проблемные фразы и правила, но не берется определять авторство. Такой подход учитывает погрешности автоматических классификаторов, из-за низкой точности которых OpenAI закрыла свой сервис в 2023 году.