· Хабр

Роль KV-кэша в оптимизации инференса авторегрессионных трансформеров

Использование KV-кэша делает современные авторегрессионные трансформеры применимыми на практике, избавляя от повторного вычисления попарных произведений ключей и запросов для каждого токена. Механизм позволяет разменивать память на скорость и рассчитывать токен за линейное время. При этом ключевым лимитирующим фактором работы модели становится пропускная способность памяти.

Читать в первоисточнике — Хабр ↗

Ещё в ленте

· Хабр · Модели · Исследования

Оптимизация выбора инструментов для локальных языковых моделей в ИИ-оркестраторе

Разработчик исследовал механизмы работы с инструментами для локальной модели Qwen 27B на видеокарте RTX 3090 в системе с более чем 90 функциями. Вместо передачи полного каталога инструментов был реализован предварительный роутер, сокращающий их выборку примерно до двадцати в зависимости от контекста запроса. Решение направлено на качественное и быстрое выполнение корпоративных задач на локальном оборудовании в закрытом контуре.

· Хабр · Исследования

Жозе Валим предложил адаптировать языки программирования под ИИ-агентов

Создатель Elixir Жозе Валим заявил о необходимости адаптировать языки программирования и инструменты разработки под ИИ-агентов, а не человека. По его мнению, цифровую среду можно быстро изменить и создать для моделей принципиально новые условия взаимодействия вместо привычного синтаксического сахара.

· Хабр · Модели · Продукты

Локальный запуск API для классификации запросов на смартфоне

Представлен быстрый аналог Jev API для классификации запросов, который работает локально на телефоне без облачных сервисов и платных подписок. Автор описал используемую модель и способ развертывания сервера для интеграции в ботов и сценарии автоматизации на Python.