Загрузка...

Каталог AI моделей и нейросетей: сравнение и цены

Каталог нейросетей с описанием возможностей и ценами в рублях. Сравните стоимость токенов и выберите лучшее решение.

  • Логотип Minimax

    MiniMax M3

    Minimax
    Скопировано!

    MiniMax-M3 — это мультимодальная базовая модель от MiniMax. Она поддерживает текстовые, графические и видео входные данные с текстовым выводом, имеет контекстное окно на 1 миллион токенов и подходит для работы на длительных горизонтах, программирования и использования инструментов. Модель построена на MiniMax Sparse Attention (MSA), который заменяет полное внимание выбором блоков KV, чтобы снизить вычислительные затраты на токен при длинном контексте — примерно в 20 раз дешевле предыдущего поколения при 1 миллионе токенов, с существенно более быстрым заполнением и декодированием, сохраняя качество выполнения большинства задач.

    Обученная как нативная мультимодальная модель на перемешанных данных и настроенная для многократного, производственного взаимодействия через интерактивную пользовательскую симуляцию, модель ориентирована на устойчивые, многошаговые задачи, а не на выполнение в один шаг.

    Входные данные:
    • Текст
    • Изображения
    • Видео
    Исходящие данные:
    • Текст
  • Логотип Stepfun

    Step 3.7 Flash

    Stepfun
    Скопировано!

    Шаг 3.7 Flash — это новейшая высокоэффективная мультимодальная модель Mixture-of-Experts от StepFun. Она сочетает языковую основу с 196 миллиардами параметров и визуальный энкодер для естественного понимания изображений и видео, активируя примерно 11 миллиардов параметров на токен. Модель поддерживает контекстное окно размером 256 тысяч и предоставляет возможность выбора уровней рассуждения (высокий/средний/низкий), позволяя пользователям балансировать между скоростью, стоимостью и глубиной рассуждений.

    Разработана для кодирования, агентных рабочих процессов, структурированных выводов и задач с длинным контекстом для повышения производительности.

    Входные данные:
    • Текст
    • Изображения
    • Видео
    Исходящие данные:
    • Текст
  • Логотип Anthropic

    Claude Opus 4.8 (Fast)

    Anthropic
    Скопировано!

    Вариант быстрого режима Opus 4.8 - идентичные возможности с более высокой скоростью вывода при цене в 2 раза выше по сравнению с обычным Opus 4.8.

    Входные данные:
    • Текст
    • Изображения
    • Файл
    Исходящие данные:
    • Текст
  • Логотип Anthropic

    Claude Opus 4.8

    Anthropic
    Скопировано!

    Claude Opus 4.8 — это самая мощная модель из семейства Opus, доступная от компании Anthropic. Она поддерживает ввод текста, изображений и файлов с текстовым выводом, обладает возможностями для рассуждений и контекстным окном в 1 миллион токенов. Модель подходит для высокоавтономных агентов, долгосрочных агентных задач, работы с информацией и задач, основанных на памяти, где важна согласованность в течение длительных сессий.

    Она особенно сильна в многошаговых рассуждениях, сложном кодировании и комплексной организации проектов — больших кодовых базах, многоэтапной отладке и длительных асинхронных агентных процессах. Помимо кодирования, она справляется с информационной работой, такой как составление документов, создание презентаций и анализ данных, поддерживая качество на протяжении очень длинных выводов.

    Входные данные:
    • Текст
    • Изображения
    • Файл
    Исходящие данные:
    • Текст
  • Логотип NVIDIA

    Parakeet TDT 0.6B v3

    NVIDIA
    Скопировано!

    Parakeet TDT 0.6B v3 — это многоязычная модель преобразования речи в текст от NVIDIA с 600 миллионами параметров, построенная на архитектуре FastConformer-TDT. Обученная на наборе данных Granary (более 670,000 часов аудио), она поддерживает автоматическое определение языка для всех официальных языков ЕС и достигает среднего уровня ошибок в словах 6.34% на доске лидеров HuggingFace Open ASR. Возвращает транскрибированный текст с пунктуацией и временными метками сегментов.

    Входные данные:
    • Аудио
    Исходящие данные:
    • Транскрибация
  • Логотип Qwen

    Qwen3.7 Max

    Qwen
    Скопировано!

    Qwen3.7-Max является флагманской моделью в серии Qwen3.7 от Alibaba. Она поддерживает ввод и вывод текста и предназначена для задач, ориентированных на агентов, с особыми преимуществами в области программирования, офисных и производительных задач, а также в долгосрочном автономном выполнении. Модель демонстрирует заметные улучшения в программировании и агентной производительности по сравнению с предыдущими поколениями Qwen и поддерживает явное кэширование подсказок для эффективного повторного использования контекста.

    Входные данные:
    • Текст
    Исходящие данные:
    • Текст
  • Логотип xAI

    SpaceXAI: Grok Build 0.1

    xAI
    Скопировано!

    Grok Build 0.1 — это быстрый модель кодирования от xAI, специально обученная для агентных рабочих процессов в области программной инженерии. Она поддерживает текстовые и графические входные данные с текстовым выводом и оптимизирована для интерактивных агентов кодирования, использования инструментов и многоэтапных задач разработки. Модель обеспечивает работу Grok Build CLI от xAI и имеет контекстное окно на 256K без ограничения на текстовый вывод, что делает её подходящей для длительных процессов кодирования и автоматизации. В настоящее время доступна в раннем доступе.

    Входные данные:
    • Текст
    • Изображения
    • Файл
    Исходящие данные:
    • Текст
  • Логотип Google

    Gemini Embedding 2

    Google
    Скопировано!

    Gemini Embedding 2 — это первая мультимодальная модель встраивания от Google. В настоящее время мы поддерживаем отображение текста и изображений в единое векторное пространство для семантического поиска и генерации с дополнением извлечением (RAG). Модель поддерживает контекст ввода до 8,192 токенов и гибкие размеры выходных данных от 128 до 3,072 (рекомендуемые: 768, 1536 или 3,072). Разработана для кросс-модальной схожести — вы можете встроить текстовый запрос и получить наиболее релевантные изображения или наоборот — что делает её хорошо подходящей для мультимодального поиска, рекомендаций и процессов понимания документов.

    Входные данные:
    • Текст
    • Изображения
    • Файл
    • Аудио
    • Видео
    Исходящие данные:
    • Embeddings
  • Логотип Google

    Gemini 3.5 Flash

    Google
    Скопировано!

    Gemini 3.5 Flash — это высокоэффективная мультимодальная модель от Google, обеспечивающая кодирование и рассуждение почти на профессиональном уровне при стоимости и скорости уровня Flash. Она высоко оптимизирована для повышения квалификации в кодировании и параллельного выполнения агентных циклов, поддерживая текстовые, графические, видео, аудио и PDF-входные данные.

    По умолчанию использует средний уровень усилий для более быстрых и экономичных ответов, с полной поддержкой уровней мышления (минимальный, низкий, средний, высокий) для тонкой настройки соотношения затрат и производительности.

    Входные данные:
    • Текст
    • Изображения
    • Видео
    • Файл
    • Аудио
    Исходящие данные:
    • Текст
  • Логотип xAI

    SpaceXAI: Grok Imagine Video

    xAI
    Скопировано!

    Grok Imagine Video — это быстрый модель генерации видео от xAI, основанная на тексте, изображениях и ссылках. Она создаёт короткие видео (1–15 секунд, 24 кадра в секунду) с разрешением 480p или 720p в семи соотношениях сторон — 1:1, 16:9, 9:16, 4:3, 3:4, 3:2 и 2:3.

    Модель поддерживает три режима генерации: текст-видео на основе одного текстового запроса, изображение-видео, которое анимирует неподвижное изображение, и ссылка-видео, где вывод основывается на до семи ссылочных изображениях для создания последовательных персонажей, стилей или настроек.

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Видео
  • Логотип xAI
    Скопировано!

    Grok Imagine Image Quality — это модель быстрого и высокоточного генерации и редактирования изображений от xAI. Она принимает текстовые подсказки и необязательные эталонные изображения, создавая фотореалистичные результаты с разрешением 1K или 2K на…

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Изображения
  • Логотип Mistral AI

    Voxtral Mini Transcribe

    Mistral AI
    Скопировано!

    Voxtral Mini Transcribe — это модель преобразования речи в текст от Mistral, созданная на основе семейства Voxtral Mini. Она принимает аудиовход и возвращает транскрибированный текст через стандартный API транскрипции. Подходит для транскрибирования встреч, голосовых заметок, подкастов и другого устного контента.

    Входные данные:
    • Аудио
    Исходящие данные:
    • Транскрибация
  • Логотип xAI

    SpaceXAI: Grok Voice TTS 1.0

    xAI
    Скопировано!

    Grok Voice TTS 1.0 — это модель преобразования текста в речь от xAI. Она преобразует текст в аудио на более чем 20 языках с автоматическим определением языка и предлагает пять встроенных голосов (Eve, Ara, Rex, Sal, Leo), охватывающих различные тона. Встроенные теги речи позволяют управлять паузами, акцентами, высотой тона, скоростью и стилем голоса. Выходные данные доступны в форматах MP3, WAV, PCM, μ-law и A-law с частотой дискретизации от 8 кГц до 48 кГц, с возможностью обработки до 15 000 символов за запрос.

    Входные данные:
    • Текст
    Исходящие данные:
    • Речь
  • Логотип Qwen

    Qwen3 ASR Flash

    Qwen
    Скопировано!

    Qwen3-ASR-Flash — это служба автоматического распознавания речи от Alibaba, основанная на платформе Qwen3-Omni и обученная на десятках миллионов часов мультимодальных речевых данных. Модель поддерживает 11 языков — включая китайский (с кантонским, сычуаньским, миньнаньским и у диалектами), английский, арабский, французский, немецкий, испанский, итальянский, португальский, русский, японский и корейский — с автоматическим определением языка, так что ручная настройка не требуется для аудио с несколькими языками.

    Модель предназначена для сложных акустических условий: она транскрибирует тексты песен на фоне музыки, обрабатывает шумные и дальние записи, фильтрует тишину и неречевые звуки, а также принимает произвольный контекстный текст (имена, жаргон, терминология домена), чтобы склонить распознавание в сторону определенного словаря.

    Входные данные:
    • Аудио
    Исходящие данные:
    • Транскрибация
  • Логотип Recraft

    Recraft V4.1 Pro Vector

    Recraft
    Скопировано!

    Recraft V4.1 Pro Vector — это векторный (SVG) вариант Recraft V4.1 Pro, настроенный на высокую эстетику. Он поддерживает ввод текста и изображений и обеспечивает вывод SVG изображений с более высоким разрешением…

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Изображения