Эксперимент Дэна Лу: почему тесты ИИ-агентов пропускают ошибки в коде
В эксперименте Дэна Лу ИИ-агент создавал тесты, которые успешно проходили даже при наличии ошибок в коде. Инструкции использовать TDD, фаззинг и формальные методы не дали убедительного общего выигрыша по сравнению с контрольной группой. Автор анализирует механизмы неэффективных проверок и демонстрирует способ контроля тестов через намеренное внесение багов.
Читать в первоисточнике — Хабр ↗
Ещё в ленте
Применение ИИ в DevOps: расследование проблем вместо автоматических правок
Опубликована вторая часть статьи о применении технологий искусственного интеллекта в практиках DevOps. В материале рассматривается подход к обучению ИИ расследованию инцидентов вместо попыток их автоматического устранения.
Визуализация работы AI-агента в Telegram: статусы, анимация и кнопка Stop
Стандартный статус «печатает…» в Telegram не позволяет пользователю отслеживать этапы длительной работы AI-агента при обращении к инструментам. Автор показал, как реализовать интерфейс с временным сообщением, анимированными иконками и кнопкой отмены задачи. Решение продемонстрировано на примере агента swift-claw.
Разработка умного прицела на базе ИИ для защиты от FPV-дронов
Широкое применение недорогих FPV-дронов создало серьезную угрозу для живой силы, против которой у пехоты пока недостаточно переносных средств защиты. В статье рассматривается концепция создания умного прицела с искусственным интеллектом для противодействия беспилотникам.
DeepSeek выпустил десктопное приложение Harness для Windows и macOS
DeepSeek представил агентный харнесс в виде отдельного приложения для Windows и macOS, работающего без Node.js и терминала. Материал разбирает процесс установки и обновления программы, ее работу в фоне, права доступа агента, а также плагины сообщества.