Роль KV-кэша в оптимизации инференса авторегрессионных трансформеров
Использование KV-кэша делает современные авторегрессионные трансформеры применимыми на практике, избавляя от повторного вычисления попарных произведений ключей и запросов для каждого токена. Механизм позволяет разменивать память на скорость и рассчитывать токен за линейное время. При этом ключевым лимитирующим фактором работы модели становится пропускная способность памяти.
Читать в первоисточнике — Хабр ↗
Ещё в ленте
Nvidia Shield TV Pro подорожала на 100 долларов из-за искусственного интеллекта
Медиаплеер Nvidia Shield TV Pro, изначально выпущенный в 2019 году, теперь продается по розничной цене 299,99 доллара. Устройство подорожало на 100 долларов из-за факторов, связанных с ИИ.
Оптимизация выбора инструментов для локальных языковых моделей в ИИ-оркестраторе
Разработчик исследовал механизмы работы с инструментами для локальной модели Qwen 27B на видеокарте RTX 3090 в системе с более чем 90 функциями. Вместо передачи полного каталога инструментов был реализован предварительный роутер, сокращающий их выборку примерно до двадцати в зависимости от контекста запроса. Решение направлено на качественное и быстрое выполнение корпоративных задач на локальном оборудовании в закрытом контуре.
Жозе Валим предложил адаптировать языки программирования под ИИ-агентов
Создатель Elixir Жозе Валим заявил о необходимости адаптировать языки программирования и инструменты разработки под ИИ-агентов, а не человека. По его мнению, цифровую среду можно быстро изменить и создать для моделей принципиально новые условия взаимодействия вместо привычного синтаксического сахара.
Локальный запуск API для классификации запросов на смартфоне
Представлен быстрый аналог Jev API для классификации запросов, который работает локально на телефоне без облачных сервисов и платных подписок. Автор описал используемую модель и способ развертывания сервера для интеграции в ботов и сценарии автоматизации на Python.