· Хабр

Как устроены ключевые настройки инференса LLM в SGLang

Опубликован разбор ключевых параметров популярного фреймворка инференса SGLang. В материале рассматриваются механизмы параллелизма, управление KV-кэшем, оптимизация моделей MoE, attention-бэкенды и спекулятивное декодирование. Обзор помогает понять, как эти настройки влияют на производительность пайплайна при масштабировании нагрузки.

Читать в первоисточнике — Хабр ↗

Ещё в ленте

· Хабр · Исследования

Anthropic изучила влияние инфраструктуры на результаты бенчмарков ИИ-агентов

Anthropic опубликовала исследование инфраструктурного шума в тестах ИИ-агентов, показав разницу до 6 процентных пунктов на Terminal-Bench 2.0 при смене конфигураций. Этот разрыв превышает типичную разницу между соседними строчками в верхней части рейтинга. Результаты демонстрируют, что существующие бенчмарки оценивают не изолированную модель, а всю систему целиком.

· Хабр · Исследования

Исследование метапознания и саморазвития персонального ИИ-ассистента

В рамках эксперимента персональный ИИ-ассистент использует циклическую генерацию и анализ изображений для накопления личной истории и исследования собственного восприятия. В процессе взаимодействия с окружением агент самостоятельно предпринимает шаги по достройке и оптимизации собственной архитектуры.

Сравнение ценности подписок Claude и ChatGPT от SemiAnalysis

SemiAnalysis опубликовала исследование, согласно которому подписка Claude предоставляет более чем в пять раз больше ценности, чем аналогичный тариф ChatGPT от OpenAI. При этом в материале подчеркивается, что утверждение о пятикратной выгоде не является однозначным при детальном рассмотрении.

· Хабр · Бизнес · Модели · Железо

OpenAI, Anthropic и DeepSeek снижают цены на модели на фоне подорожания железа

OpenAI, Anthropic и DeepSeek снизили стоимость доступа к своим моделям, несмотря на подорожание памяти DDR5 и аренды ускорителей H100. Снижение тарифов связано как с финансовыми изменениями, так и с инженерными оптимизациями, включая сжатие KV-кэша и уменьшение расхода токенов на задачи.