Загрузка...

Каталог AI моделей и нейросетей: сравнение и цены

Каталог нейросетей с описанием возможностей и ценами в рублях. Сравните стоимость токенов и выберите лучшее решение.

  • Логотип Qwen

    Qwen3.6 27B

    Qwen
    Скопировано!

    Qwen3.6 27B — это плотная языковая модель с 27 миллиардами параметров от команды Qwen в Alibaba, выпущенная в апреле 2026 года. Она обладает гибридными мультимодальными возможностями — принимает текстовые, графические и видео входные данные — и поддерживает контекстное окно на 262 144 токена.

    Модель предназначена для агентного кодирования и задач рассуждения, с особой силой в понимании кода на уровне репозиториев, рабочих процессах фронтенд-разработки и многошаговом решении проблем. Она включает встроенный режим мышления для расширенного рассуждения и сохраняет контекст мышления на протяжении всей истории общения. Qwen3.6 27B поддерживает 201 язык и диалект и выпущена под лицензией Apache 2.0.

    Входные данные:
    • Текст
    • Изображения
    • Видео
    Исходящие данные:
    • Текст
  • Логотип OpenAI

    GPT-5.5 Pro

    OpenAI
    Скопировано!

    GPT-5.5 Pro — это высокоэффективная модель OpenAI, оптимизированная для глубокого анализа и точности при выполнении сложных, критически важных задач. Она обладает контекстным окном более 1 миллиона токенов (922K на входе, 128K на выходе) с поддержкой текстовых и графических данных и предназначена для решения задач с длинным горизонтом, агентного программирования и точного выполнения многошаговых рабочих процессов.

    Входные данные:
    • Файл
    • Изображения
    • Текст
    Исходящие данные:
    • Текст
  • Логотип OpenAI

    GPT-5.5

    OpenAI
    Скопировано!

    GPT-5.5 — новейшая модель от OpenAI, позиционируемая как «новый класс интеллекта». Она обладает контекстным окном более чем на 1 миллион токенов (922 тыс. на вход и 128 тыс. на выход) с поддержкой текстовых и графических входных данных, что позволяет выполнять высококонтек стное рассуждение, программирование и мультимодальный анализ в рамках одного рабочего процесса.

    Модель обеспечивает улучшенную производительность в программировании, понимании документов, использовании инструментов и следовании инструкциям. Она разработана как мощный инструмент по умолчанию как дл я общих задач, так и для программной инженерии, способная генерировать код производственного качества, синтезировать информацию из множества источников и выполнять сложные многоэтапные рабочие процессы с меньшим числом итераций и большей эффективностью использования токенов.

    Входные данные:
    • Файл
    • Изображения
    • Текст
    Исходящие данные:
    • Текст
  • Логотип DeepSeek

    DeepSeek V4 Flash 0423

    DeepSeek
    Скопировано!

    DeepSeek V4 Flash — это оптимизированная по эффективности модель Mixture-of-Experts от DeepSeek с общим количеством параметров 284 миллиардов и 13 миллиардов активированных параметров, поддерживающая контекстное окно на 1 миллион токенов. Она разработана для быстрого вывода и высокопроизводительных рабочих нагрузок, при этом сохраняя сильные способности к рассуждению и кодированию.

    Модель включает гибридное внимание для эффективной обработки длинного контекста. Поддерживаются уровни рассуждений high и xhigh; xhigh соответствует максимальному уровню рассуждений. Она хорошо подходит для таких приложений, как помощники по кодированию, системы чатов и рабочие процессы агентов, где важны быстрота отклика и экономическая эффективность.

    Входные данные:
    • Текст
    Исходящие данные:
    • Текст
  • Логотип Google

    Gemini 3.1 Flash TTS Preview

    Google
    Скопировано!

    Gemini 3.1 Flash TTS Preview — это модель преобразования текста в речь от Google, представляющая собой значительный шаг вперед по сравнению с Gemini 2.5 Flash TTS. Она принимает текстовый ввод и выдает аудиовывод на более чем 70 языках — почти в 3 раза больше языков, чем у ее предшественника.

    Главное нововведение — это система из более чем 200 встроенных аудиотегов (например, [whispers], [laughs], [excited]), которые позволяют разработчикам управлять подачей, эмоциями и темпом внутри предложения, а также рабочий процесс “режиссерское кресло” в Google AI Studio для определения аудиопрофилей для каждого персонажа и контекста на уровне сцены. Она поддерживает до двух дикторов с независимой настройкой голоса и стиля для каждого диктора, выдает аудио в формате PCM с частотой 24 кГц / 16-бит моно и автоматически добавляет водяные знаки на все выходные данные с помощью SynthID. Контекстное окно составляет 32 тысячи токенов.

    Входные данные:
    • Текст
    Исходящие данные:
    • Речь
  • Логотип Google

    Veo 3.1 Fast

    Google
    Скопировано!

    Модель среднего уровня для генерации видео от Google, сочетающая скорость и качество. Veo 3.1 Fast создает видео высокого качества из текстовых или графических подсказок с нативным синхронизированным звуком, обеспечивая более быструю обработку, чем Veo 3.1, по более низкой цене. Поддерживает кондиционирование первого и последнего кадра, несколько разрешений и соотношений сторон, а также водяные знаки SynthID.

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Видео
  • Логотип Canopylabs

    Orpheus 3B

    Canopylabs
    Скопировано!

    Orpheus 3B — это английская модель преобразования текста в речь от Canopy Labs, настроенная для естественной просодии и выразительной подачи. Она предлагает 7 предустановленных голосов и подходит для озвучивания, голосовых помощников и интерактивных приложений, где приоритетом является естественная речь.

    Входные данные:
    • Текст
    Исходящие данные:
    • Речь
  • Логотип Sesame

    CSM 1B

    Sesame
    Скопировано!

    CSM 1B — это модель разговорной речи от Sesame. Она принимает текстовый ввод и производит выходную речь на английском языке, с голосовыми опциями, охватывающими стили разговорной и читаемой речи. С 1B параметрами она подходит для приложений, ориентированных на диалог, таких как голосовые помощники и интерактивные агенты.

    Входные данные:
    • Текст
    Исходящие данные:
    • Речь
  • Логотип Hexgrad

    Kokoro 82M

    Hexgrad
    Скопировано!

    Kokoro 82M — это легковесная модель преобразования текста в речь от hexgrad. Она преобразует текст в речь на 8 языках (американский и британский английский, испанский, французский, хинди, итальянский, японский, португальский и китайский) с использованием 54 предустановленных голосов, организованных по языку и полу. С 82 миллионами параметров она отлично подходит для многоязычных развертываний TTS, где важны компактность и экономическая эффективность.

    Входные данные:
    • Текст
    Исходящие данные:
    • Речь
  • Логотип Google

    Veo 3.1 Lite

    Google
    Скопировано!

    Самая экономичная модель генерации видео от Google, разработанная для приложений с большим объемом и быстрой итерацией. Veo 3.1 Lite генерирует видео в разрешении 720p и 1080p из текстовых или графических подсказок с нативным синхронизированным звуком по цене менее 50% от стоимости Veo 3.1 Fast. Поддерживает клипы длительностью 4–8 секунд в ландшафтном (16:9) и портретном (9:16) форматах с водяными знаками SynthID. Идеально подходит для контентных платформ, создания коротких видео и автоматизированной генерации медиа.

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Видео
  • Логотип Inclusionai

    Ling-2.6-1T

    Inclusionai
    Скопировано!

    Ling-2.6-1T — это мгновенная (инструкционная) модель от inclusionAI и флагман компании с триллионом параметров, разработанная для агентов реального мира, которым требуется быстрое выполнение и высокая эффективность в масштабах. Она использует подход «быстрого мышления», чтобы сократить затраты примерно до четверти от аналогичных моделей, сохраняя при этом первоклассную производительность.

    Модель достигает передовых результатов на таких тестах, как AIME26 и SWE-bench Verified, и хорошо подходит для продвинутого кодирования, сложных рассуждений и крупных рабочих процессов агентов, где критически важны как возможности, так и эффективность.

    Входные данные:
    • Текст
    Исходящие данные:
    • Текст
  • Логотип Tencent

    Hy3 preview

    Tencent
    Скопировано!

    Hy3 preview — это высокоэффективная модель Mixture-of-Experts от Tencent, предназначенная для агентных рабочих процессов и использования в производстве. Она поддерживает настраиваемые уровни рассуждений в режимах отключено, низкий и высокий, что позволяет балансировать между скоростью и глубиной в зависимости от задачи, обеспечивая при этом сильную генерацию кода и надежную производительность в многошаговых, реальных рабочих процессах.

    Входные данные:
    • Текст
    Исходящие данные:
    • Текст
  • Логотип Xiaomi

    MiMo-V2.5-Pro

    Xiaomi
    Скопировано!

    MiMo-V2.5-Pro — это флагманская модель Xiaomi, обеспечивающая высокую производительность в общих агентных возможностях, сложной программной инженерии и задачах с долгосрочным горизонтом, с лидирующими позициями в таких бенчмарках, как ClawEval, GDPVal и SWE-bench Pro.

    Входные данные:
    • Текст
    Исходящие данные:
    • Текст
  • Логотип Xiaomi

    MiMo-V2.5

    Xiaomi
    Скопировано!

    MiMo-V2.5 — это родная омнимодальная модель от Xiaomi. Она обеспечивает профессиональный уровень агентной производительности примерно за половину стоимости вывода, превосходя MiMo-V2-Omni в мультимодальном восприятии при выполнении задач по пониманию изображений и видео. Ее контекстное окно на 1M поддерживает полные документы, расширенные разговоры и сложные контексты задач за один проход, что делает ее идеальной для интеграции с агентными фреймворками, где важны сильные рассуждения, богатое восприятие и экономическая эффективность.

    Входные данные:
    • Текст
    • Аудио
    • Изображения
    • Видео
    Исходящие данные:
    • Текст
  • Логотип OpenAI

    GPT-5.4 Image 2

    OpenAI
    Скопировано!

    Image 2 объединяет модель GPT-5.4 от OpenAI с передовыми возможностями генерации изображений от GPT Image 2. Это позволяет создавать богатые мультимодальные рабочие процессы, позволяя пользователям без труда переходить от рассуждений и программирования к визуальной генерации в рамках одного взаимодействия.

    Входные данные:
    • Изображения
    • Текст
    • Файл
    Исходящие данные:
    • Изображения
    • Текст