· Хабр

Эксперимент Дэна Лу: почему тесты ИИ-агентов пропускают ошибки в коде

В эксперименте Дэна Лу ИИ-агент создавал тесты, которые успешно проходили даже при наличии ошибок в коде. Инструкции использовать TDD, фаззинг и формальные методы не дали убедительного общего выигрыша по сравнению с контрольной группой. Автор анализирует механизмы неэффективных проверок и демонстрирует способ контроля тестов через намеренное внесение багов.

Читать в первоисточнике — Хабр ↗

Ещё в ленте

· Хабр · Продукты

Применение ИИ в DevOps: расследование проблем вместо автоматических правок

Опубликована вторая часть статьи о применении технологий искусственного интеллекта в практиках DevOps. В материале рассматривается подход к обучению ИИ расследованию инцидентов вместо попыток их автоматического устранения.

· Хабр · Продукты

Визуализация работы AI-агента в Telegram: статусы, анимация и кнопка Stop

Стандартный статус «печатает…» в Telegram не позволяет пользователю отслеживать этапы длительной работы AI-агента при обращении к инструментам. Автор показал, как реализовать интерфейс с временным сообщением, анимированными иконками и кнопкой отмены задачи. Решение продемонстрировано на примере агента swift-claw.

Разработка умного прицела на базе ИИ для защиты от FPV-дронов

Широкое применение недорогих FPV-дронов создало серьезную угрозу для живой силы, против которой у пехоты пока недостаточно переносных средств защиты. В статье рассматривается концепция создания умного прицела с искусственным интеллектом для противодействия беспилотникам.

· Хабр · Продукты

DeepSeek выпустил десктопное приложение Harness для Windows и macOS

DeepSeek представил агентный харнесс в виде отдельного приложения для Windows и macOS, работающего без Node.js и терминала. Материал разбирает процесс установки и обновления программы, ее работу в фоне, права доступа агента, а также плагины сообщества.