Alibaba Cloud представила новую мультимодальную модель Qwen3.8-Omni-Flash, которая может одновременно работать с текстом, изображениями, аудио и видео. Новинка ориентирована не только на анализ мультимедийного контента, но и на выполнение сложных задач с использованием ИИ-агентов.
Qwen3.8-Omni-Flash получила контекстное окно объемом до 1 млн токенов. Модель принимает текст, изображения, аудио и видео, а результат в основной версии выдает в текстовом формате. Она также поддерживает вызов внешних функций, веб-поиск и режим рассуждений с возможностью регулировать его глубину.
Разработчики делают акцент на работе с длинными аудио- и видеоматериалами. Например, модель может анализировать многочасовые записи, находить необходимые фрагменты, составлять стенограммы встреч, определять участников разговора, выделять задачи и формировать резюме. Для видео можно задавать конкретные требования к анализу — временной диапазон, объект поиска, степень детализации и формат ответа.
Кроме того, Alibaba расширяет Qwen3.8-Omni-Flash в сторону агентных сценариев. Модель может использовать инструменты для выполнения многоэтапных задач, связанных с монтажом видео, переводом, созданием видеокомментариев и обработкой мультимедийного контента. Компания также представила версию Qwen3.8-Omni-Flash-Realtime для взаимодействия с аудио и видео в режиме реального времени.
По данным Alibaba Cloud, средний результат Qwen3.8-Omni-Flash в 29 внутренних и отраслевых тестах более чем на 25% превышает показатель Qwen3.5-Omni-Plus. Компания также заявляет о существенном снижении стоимости обработки аудио и аудиовизуального контента через API по сравнению с предыдущей моделью.
Модель доступна через Alibaba Cloud Model Studio и поддерживает совместимые с OpenAI интерфейсы Chat Completions и Responses.
