Скопировано!
Qwen3-VL-235B-A22B Thinking — это мультимодальная модель, объединяющая мощную генерацию текста с визуальным пониманием изображений и видео. Модель Thinking оптимизирована для мультимодального рассуждения в STEM и математике. Серия делает акцент на надежном восприятии (распознавание разнообразных реальных и синтетических категорий), пространственном понимании (привязка к 2D/3D) и долгосрочном визуальном понимании, демонстрируя конкурентоспособные результаты на публичных мультимодальных тестах как для восприятия, так и для рассуждения.
Помимо анализа, Qwen3-VL поддерживает агентное взаимодействие и использование инструментов: она может следовать сложным инструкциям в диалогах с несколькими изображениями и несколькими этапами; синхронизировать текст с временными шкалами видео для точных временных запросов; и управлять элементами графического интерфейса для автоматизации задач. Модели также поддерживают рабочие процессы визуального кодирования, превращая эскизы или макеты в код и помогая с отладкой интерфейса, сохраняя при этом высокую производительность только на текстовом уровне, сравнимую с флагманскими языковыми моделями Qwen3. Это делает Qwen3-VL подходящей для производственных сценариев, охватывающих документальный ИИ, многоязычный OCR, помощь с программным обеспечением/интерфейсом, пространственные/воплощенные задачи и исследования агентов, работающих с видением и языком.