Масштабное тестирование модели Jev в сравнении с решениями OpenAI
Автор провел 22 эксперимента и отправил около 160 тысяч запросов к jev-1.13.0 и контрольным моделям OpenAI для проверки границ практического применения. Исследование было направлено на оценку точности, надежности показателей уверенности при роутинге, а также поведения при длинном контексте и зашумленных данных. Результаты помогают заранее выявить ограничения модели до ее интеграции в рабочие процессы.
Читать в первоисточнике — Хабр ↗
Ещё в ленте
Эволюция интерфейсов и преодоление ограничений LLM при работе с сайтами
Развитие LLM вернуло текстовый формат взаимодействия, однако при работе с внешними сервисами модели часто сталкиваются с антибот-защитой и санкционными ограничениями. Появились новые инструменты, призванные расширить возможности систем при взаимодействии с веб-ресурсами.
Научный обзор технологий Wi-Fi-сенсинга: данные, модели и барьеры внедрения
Опубликован обзор актуальных научных исследований в области Wi-Fi-сенсинга, посвященный используемым данным и моделям. В материале рассматривается текущее состояние технологии и причины, по которым решения на ее основе пока с трудом выходят из лабораторий на потребительский рынок.
Стартап Legato выпустил умные очки с ИИ для людей с нарушениями слуха
Стартап Legato представил слуховые очки с искусственным интеллектом. Устройство призвано сделать помощь людям с нарушениями слуха более доступной, снижая стоимость решения, а также устраняя дискомфорт и стигматизацию, присущие традиционным слуховым аппаратам.
Claude Opus 5 расходует в 3,9 раза больше токенов на русский текст, чем GPT-5.5
Сравнение 11 токенизаторов показало, что модель Claude Opus 5 расходует на русский язык почти в четыре раза больше токенов, чем GPT-5.5, из-за чего итоговая стоимость работы с текстом существенно возрастает. В то же время у моделей YandexGPT и GigaChat токенизация русскоязычного текста оказалась наиболее эффективной — до пяти символов на токен. Автор исследования также представил методику пересчета стоимости и программный код для самостоятельных замеров.