Загрузка...

Каталог AI моделей и нейросетей: сравнение и цены

Каталог нейросетей с описанием возможностей и ценами в рублях. Сравните стоимость токенов и выберите лучшее решение.

  • Логотип Google

    Chirp 3

    Google
    Скопировано!

    Chirp 3 — это последняя многоязычная модель распознавания речи от Google. Она обеспечивает повышенную точность транскрипции для 24 языков GA и более 77 языков в режиме предварительного просмотра, поддерживая автоматическое определение языка, автоматическую пунктуацию и встроенный шумоподавитель для более чистой обработки аудио.

    Входные данные:
    • Аудио
    Исходящие данные:
    • Транскрибация
  • Логотип OpenAI

    GPT-4o Mini Transcribe

    OpenAI
    Скопировано!

    GPT-4o Mini Transcribe — это более компактная и экономичная модель преобразования речи в текст от OpenAI, основанная на аудиовозможностях GPT-4o Mini. Она оценивается по количеству токенов (входных и выходных), что делает её подходящей для рабочих процессов с большим объёмом транскрипций, которые выигрывают от прозрачности биллинга на уровне токенов при более низкой стоимости.

    Входные данные:
    • Аудио
    Исходящие данные:
    • Транскрибация
  • Логотип OpenAI

    Whisper Large V3 Turbo

    OpenAI
    Скопировано!

    Whisper Large V3 Turbo — это оптимизированная версия модели распознавания речи Whisper Large V3 от OpenAI, разработанная для повышения скорости и экономической эффективности. Она поддерживает транскрипцию на более чем 99 языках с уровнем ошибок в словах 12% и принимает распространенные аудиоформаты, включая mp3, mp4, wav, webm, flac и ogg. Достигает скорости в реальном времени до 216 раз, что делает её подходящей для задач, чувствительных к задержкам, и для высокопроизводительных рабочих нагрузок по транскрипции.

    Входные данные:
    • Аудио
    Исходящие данные:
    • Транскрибация
  • Логотип OpenAI

    Whisper Large V3

    OpenAI
    Скопировано!

    Whisper Large V3 — это модель автоматического распознавания речи с открытым исходным кодом от OpenAI, предлагающая как транскрипцию, так и перевод аудио. Она поддерживает более 99 языков и принимает распространенные аудиоформаты, включая mp3, mp4, wav, webm, flac и ogg. С 1,550 миллионами параметров она достигает уровня ошибок в словах 10,3% и хорошо подходит для многозадачной транскрипции в условиях шума. Поддерживает временные метки на уровне слов и сегментов.

    Входные данные:
    • Аудио
    Исходящие данные:
    • Транскрибация
  • Логотип xAI

    SpaceXAI: Grok 4.3

    xAI
    Скопировано!

    Grok 4.3 — это модель рассуждений от xAI. Она принимает текстовые и графические входные данные с текстовым выводом и подходит для агентных рабочих процессов, задач по следованию инструкциям и приложений, требующих высокой точности фактов. Уровень усилий для рассуждений можно настроить на отсутствие/низкий/средний/высокий (по умолчанию низкий).

    Она поддерживает контекстное окно на 1 миллион токенов без ограничения на количество выходных токенов, что делает её хорошо подходящей для анализа длинных документов, глубоких исследований и многоэтапных агентных задач. Цены распределяются по уровням: запросы, превышающие 200 тысяч токенов, тарифицируются по более высокой ставке.

    Входные данные:
    • Текст
    • Изображения
    • Файл
    Исходящие данные:
    • Текст
  • Логотип Ibm-granite

    Granite 4.1 8B

    Ibm-granite
    Скопировано!

    Granite 4.1 8B — это плотная языковая модель с 8 миллиардами параметров от IBM, являющаяся частью семейства Granite 4.1. Она поддерживает контекстное окно на 131 тысячу токенов и предназначена для выполнения корпоративных задач, включая вызов инструментов, генерацию с дополнением извлеченной информации (RAG), генерацию кода с поддержкой заполнения в середине, суммирование текста, классификацию и извлечение.

    Модель обрабатывает 12 языков (английский, немецкий, испанский, французский, японский, португальский, арабский, чешский, итальянский, корейский, голландский и китайский) и реализует вызов инструментов, совместимый с OpenAI. Выпущена под лицензией Apache 2.0.

    Входные данные:
    • Текст
    Исходящие данные:
    • Текст
  • Логотип Mistral AI

    Mistral Medium 3.5

    Mistral AI
    Скопировано!

    Mistral Medium 3.5 — это плотная модель следования инструкциям 128B от Mistral AI. Она поддерживает ввод текста и изображений с выводом текста и предназначена для агентных рабочих процессов, программирования и сложного многоэтапного рассуждения. Модель особенно сильна в надежном вызове нескольких инструментов и задачах с длинным горизонтом, имеет контекстное окно 256K, настраиваемое усилие рассуждения на запрос и пользовательский кодировщик изображений, который обрабатывает переменные размеры и соотношения сторон изображений. Может быть размещена на собственных серверах всего на четырех GPU и доступна с открытыми весами.

    Входные данные:
    • Текст
    • Изображения
    • Файл
    Исходящие данные:
    • Текст
  • Логотип Kwaivgi

    Kling: Video v3.0 Pro

    Kwaivgi
    Скопировано!

    Kling v3.0 Pro — это премиальная модель генерации видео от Kuaishou, предлагающая более высокое визуальное качество по сравнению со стандартным уровнем. Она поддерживает рабочие процессы от текста к видео и от изображения к видео, с контролем первого и последнего кадра для точного составления сцены. Длина клипов варьируется от 3 до 15 секунд в соотношениях сторон 16:9, 9:16 или 1:1. Генерация оригинального аудио доступна в качестве опции.

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Видео
  • Логотип Kwaivgi

    Kling: Video v3.0 Standard

    Kwaivgi
    Скопировано!

    Kling v3.0 Standard — это модель генерации видео от Kuaishou. Она поддерживает рабочие процессы от текста к видео и от изображения к видео, с контролем первого и последнего кадра для направленного составления сцены. Длительность клипов варьируется от 3 до 15 секунд в соотношениях сторон 16:9, 9:16 или 1:1. Генерация аудио на родном языке доступна в качестве опции.

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Видео
  • Логотип OpenAI

    Whisper 1

    OpenAI
    Скопировано!

    Whisper — это модель автоматического распознавания речи с открытым исходным кодом от OpenAI, доступная через API как whisper-1. Она поддерживает транскрипцию и перевод более чем на 50 языков из аудиофайлов размером до 25 МБ. Принимает форматы, включая mp3, mp4, wav и webm. Стоимость рассчитывается за минуту длительности аудио, с округлением до ближайшей секунды.

    Входные данные:
    • Аудио
    Исходящие данные:
    • Транскрибация
  • Логотип OpenAI

    GPT-4o Transcribe

    OpenAI
    Скопировано!

    GPT-4o Transcribe — это высококачественная модель преобразования речи в текст от OpenAI, основанная на аудиовозможностях GPT-4o. Ценообразование осуществляется за каждый токен (входной и выходной), что делает её подходящей для рабочих процессов, которым выгодна прозрачность биллинга на уровне токенов.

    Входные данные:
    • Аудио
    Исходящие данные:
    • Транскрибация
  • Логотип Qwen

    Qwen3.5 Plus 2026-04-20

    Qwen
    Скопировано!

    Qwen3.5 Plus (апрель 2026) — это крупномасштабная мультимодальная языковая модель от Alibaba. Она принимает текстовый, графический и видео ввод и выдает текстовый вывод с контекстным окном в 1 миллион токенов. Это обновленная версия Qwen3.5 Plus с многоуровневым ценообразованием для объемов свыше 256 тысяч токенов.

    Входные данные:
    • Текст
    • Изображения
    • Видео
    Исходящие данные:
    • Текст
  • Логотип Qwen

    Qwen3.6 Flash

    Qwen
    Скопировано!

    Qwen3.6 Flash — это быстрый и эффективный языковой модель из серии Qwen 3.6 от Alibaba. Она поддерживает ввод текста, изображений и видео с контекстным окном в 1 миллион токенов. Поэтапное ценообразование начинается при превышении 256 тысяч токенов. Поддерживается кеширование запросов, с ценообразованием как на чтение из кеша, так и на создание кеша.

    Входные данные:
    • Текст
    • Изображения
    • Видео
    Исходящие данные:
    • Текст
  • Логотип Qwen

    Qwen3.6 35B A3B

    Qwen
    Скопировано!

    Qwen3.6-35B-A3B — это мультимодальная модель с открытым весом от Alibaba Cloud, содержащая 35 миллиардов общих параметров и 3 миллиарда активных параметров на токен. Она использует гибридную разреженную архитектуру смеси экспертов, объединяющую линейное внимание Gated DeltaNet с обычными слоями с управляемым вниманием, что позволяет эффективно выполнять вывод при значительно меньших вычислительных затратах. Модель поддерживает нативное контекстное окно в 262 тысячи токенов (расширяемое до 1 миллиона с помощью YaRN) и принимает текстовые, графические и видео входные данные. Она включает интегрированный режим мышления с сохранением следов рассуждений в многократных диалогах, вызов функций и структурированный вывод. Выпущена под лицензией Apache 2.0.

    Входные данные:
    • Текст
    • Изображения
    • Видео
    Исходящие данные:
    • Текст
  • Логотип Qwen

    Qwen3.6 Max Preview

    Qwen
    Скопировано!

    Qwen3.6-Max-Preview — это собственная передовая модель от Alibaba Cloud, построенная на архитектуре разреженной смеси экспертов с примерно 1 триллионом параметров. Она оптимизирована для агентного кодирования, использования инструментов и рассуждений в длинном контексте, поддерживая окно контекста в 262 тысячи токенов. Модель включает интегрированный режим мышления, который сохраняет следы рассуждений в многократных диалогах и поддерживает структурированный вывод и вызов функций. Доступ предоставляется исключительно через Alibaba Cloud Model Studio и Qwen Studio API; открытые веса не предоставляются.

    Входные данные:
    • Текст
    Исходящие данные:
    • Текст