· Хабр

Gemini 4 Argon лидирует в тестах на фоне снижения значимости бенчмарков

Google представила результаты Gemini 4 Argon, где модель лидирует в 12 из 18 тестов. Ранее Gemini 3.1 Pro с аналогичной таблицей результатов уступила Claude в реальных задачах более 300 очков. Ситуация демонстрирует, что победа в тестах все меньше говорит о фактическом качестве работы моделей.

Читать в первоисточнике — Хабр ↗

Ещё в ленте

· TechCrunch · Безопасность · Продукты

Circuit Breaker Labs разработала решение для защиты пользователей от психологического вреда ИИ

Компания Circuit Breaker Labs создала виртуальные аналоги краш-тест манекенов для проверки безопасности искусственного интеллекта. Разработка призвана предотвратить психологический вред, который ИИ-системы могут наносить детям и взрослым пользователям.

· Хабр · Модели

Как устроена базовая нейросеть: разбор принципов работы без калькулятора

Автор статьи подготовил наглядное объяснение базовых принципов работы нейронных сетей без применения компьютера и калькулятора. Материал оформлен в виде письма, в котором логика вычислений и матричных операций демонстрируется на примере решения задачи XOR.

· OpenAI · Модели · Продукты

Руководство OpenAI по выбору и настройке моделей семейства GPT-6

OpenAI представила руководство для стартапов по работе с семейством моделей GPT-6. В публикации рассказывается о подборе моделей, регулировке глубины рассуждений, улучшении промптов и координации инструментов. Также рассматривается подготовка рабочих процессов к запуску в продакшене.

· MIT Technology Review · Бизнес

Инвестиции в искусственный интеллект достигнут 2,5 трлн долларов к 2026 году

Корпоративный искусственный интеллект переходит в стадию активного практического применения. Возможности моделей растут быстрее способности компаний их осваивать, при этом стоимость производительности продолжает снижаться. По прогнозам, к 2026 году мировые инвестиции в сферу AI увеличатся на 44% и составят 2,5 триллиона долларов.