· Хабр

Ускорение локальных LLM на Mac с помощью движка Splash

Опубликован разбор движка Splash, ускоряющего работу локальных языковых моделей на macOS за счет спекулятивного декодирования DFlash 2. В материале рассматриваются результаты тестов, ограничения системы, требования к памяти и диску, а также нюансы выбора квантования Q4 и Q8.

Читать в первоисточнике — Хабр ↗

Ещё в ленте

· Хабр · Исследования · Модели

Подход к формированию смысловых эмбеддингов в нейросетях

В публикации рассматривается концепция создания смысловых эмбеддингов для нейронных сетей. Предложенная идея призвана позволить моделям строить векторные представления смысловых структур, а не только отдельных токенов.

· Хабр · Модели · Исследования

LSWM 2.0: доработка экспериментальной нейросетевой архитектуры

Автор проекта LSWM провел дополнительное тестирование модели и выявил в ней множество технических проблем. В публикации представлены попытки исправить обнаруженные недочеты и улучшить архитектуру сети.

· Хабр · Open source · Исследования

MWS AI представила RESON и RESON OSD для оценки моделей распознавания речи

Команда направления Audiogram в MWS AI выпустила в открытый доступ два новых инструмента для работы с речевыми технологиями. Релиз включает инструмент для анализа качества ASR-моделей RESON, а также открытый бенчмарк RESON OSD, предназначенный для тестирования распознавания русскоязычной речи.

· Хабр · Железо · Бизнес

Huawei и Alibaba представили новые аппаратные решения для ИИ

Huawei и Alibaba практически одновременно анонсировали новое аппаратное обеспечение для задач искусственного интеллекта. Вместо копирования архитектуры NVIDIA китайские разработчики создают собственные решения для объединения тысяч чипов в условиях ограниченного доступа к западным технологиям.