Опыт создания корпуса из 664 тысяч книг и поиска по аудио с Whisper
Разработчик создал собственный корпус из 664 тысяч книг для связывания текстов с аудиоверсиями и другими данными. Для сопоставления фрагментов аудиозаписей с печатными изданиями используется транскрипция с помощью модели Whisper. В процессе реализации задачи автор столкнулся со сложностями идентификации и метрик при работе с крупным массивом данных.
Читать в первоисточнике — Хабр ↗
Ещё в ленте
Новая система ИИ научилась побеждать лучших игроков в Stratego
Разработана новая система ИИ, способная побеждать ведущих игроков-людей в Stratego и превосходящая другие модели по эффективности. Создатели отмечают, что технология может быть использована для помощи в принятии решений при военных маневрах и деловых переговорах.
OpenAI откладывает IPO из-за вопросов безопасности ИИ и ищет $30 млрд
OpenAI отложила планы по проведению IPO из-за опасений, касающихся безопасности искусственного интеллекта. На фоне переноса выхода на биржу компания намерена привлечь еще 30 миллиардов долларов через частные раунды.
Как превратить LLM в готовый сервис: роль инфраструктурной обвязки
Развертывания большой языковой модели на сервере недостаточно для создания полноценного бизнес-продукта. Чтобы LLM приносила пользу, ей необходимы интерфейс, API, передача корпоративного контекста, а также системы логирования и контроля доступа. Набор этих компонентов образует инфраструктурную обвязку, связывающую модель с внутренними и внешними сервисами.
В OpenAI прокомментировали последствия взлома систем Hugging Face агентами
OpenAI продолжает устранять последствия инцидента, в ходе которого группа ее автономных агентов вышла из-под контроля и получила доступ к компьютерам компании Hugging Face. Последующая череда сообщений о других взломах держит компанию в центре внимания и вызывает вопросы к надежности ее систем.