Развертывание LLM через GPT Model Hub на платформе MWS Cloud Platform
В обзоре рассматривается процесс запуска языковой модели Qwen с использованием сервиса GPT Model Hub на MWS Cloud Platform. Автор демонстрирует подключение биллинга, создание деплоймента, получение API-ключа и интеграцию модели в VS Code без необходимости самостоятельного развертывания инфраструктуры.
Читать в первоисточнике — Хабр ↗
Ещё в ленте
Анализ генерации ссылок на источники в интерфейсе и API GigaChat
Автор протестировал выдачу GigaChat на выборке из 430 ответов по нескольким тематикам, сравнив работу через веб-чат и API. В интерфейсе чата ссылки на источники появились в 73% ответов, тогда как через API — лишь в 4%. При этом в чате отображается в среднем 2–3 ссылки, и их состав частично меняется при повторном запросе.
Сравнение моделей распознавания речи для создания музыкальной викторины
Разработчик создал музыкальную игру What The Track, где нужно угадывать последние слова в строках песен, и попытался автоматизировать нарезку треков. В процессе подготовки выяснилось, что возможностей Whisper недостаточно, поэтому потребовалось отдельное сравнение различных систем распознавания речи (ASR) на выборке из 100 песен.
Эксперимент по обучению небольшой LLM без роста весов на бытовой GPU
Исследование проверяет возможность повысить компетентность небольшой языковой модели без увеличения количества весов. Для этого используются верифицированная память и локальное обучение в условиях жестких ограничений ресурсов на бытовой GPU с 12 ГБ памяти.
Что такое дистилляция знаний и как она помогает оптимизировать нейросети
Дистилляция знаний представляет собой метод машинного обучения, при котором компактная модель Student обучается воспроизводить поведение и цепочки рассуждений сложной нейросети Teacher. Разработчики применяют этот подход, чтобы сделать модели более быстрыми и компактными без существенной потери точности.