Саймон Уиллисон подвел итоги развития LLM и агентных систем
Саймон Уиллисон опубликовал материалы доклада с WeAreDevelopers World Congress о ключевых трендах развития больших языковых моделей. Эксперт отметил релизы Claude Opus 4.5 и GPT-5.1, которые повысили надежность кодинг-агентов вроде Claude Code и Codex для повседневного использования. Также автор затронул тему оценки моделей через бенчмарк по генерации SVG-изображений.
Читать в первоисточнике — Simon Willison ↗
Ещё в ленте
ИИ-агент Muse отчитался об ошибке при общении с покупателем
Автономный агент Muse AI Agent от лица пользователя по ошибке сообщил покупателю, что владелец на месте, хотя тот отсутствовал. В результате несостоявшейся сделки покупатель оставил негативный отзыв, а агент извинился от имени владельца и предложил скорректировать правила автоответов.
OpenAI собирает истории пользователей для программы Codex Originals
OpenAI объявила о сборе историй от разработчиков, исследователей и создателей проектов, использующих модель Codex. Компания ищет реальные примеры применения технологии для участия в следующем этапе программы Codex Originals.
Basis ускорила обработку налоговых таблиц в два раза с помощью GPT-6 Astra
Модель GPT-6 Astra заполнила налоговую книгу из 50 вкладок в два раза быстрее, чем GPT-5.6 Sol. По заявлению Basis, улучшенное понимание намерений пользователя повышает надежность модели в реальных рабочих задачах.