Загрузка...

Каталог AI моделей и нейросетей: сравнение и цены

Каталог нейросетей с описанием возможностей и ценами в рублях. Сравните стоимость токенов и выберите лучшее решение.

  • Логотип Google

    Gemma 4 31B

    Google
    Скопировано!

    Gemma 4 31B Instruct — это плотная мультимодальная модель от Google DeepMind с 30,7 миллиардами параметров, поддерживающая текстовый и визуальный ввод с текстовым выводом. Обладает контекстным окном на 256 тысяч токенов, настраиваемым режимом мышления/рассуждения, возможностью нативного вызова функций и многоязычной поддержкой более чем на 140 языках. Сильна в задачах программирования, рассуждения и понимания документов. Лицензия Apache 2.0.

    Входные данные:
    • Изображения
    • Текст
    • Видео
    Исходящие данные:
    • Текст
  • Логотип Qwen

    Qwen3.6 Plus

    Qwen
    Скопировано!

    Qwen 3.6 Plus основывается на гибридной архитектуре, которая сочетает эффективное линейное внимание с маршрутизацией редкой смеси экспертов, обеспечивая высокую масштабируемость и высокопроизводительный вывод. По сравнению с серией 3.5, она обеспечивает качественный скачок в задачах агентного программирования и полноценном мультимодальном восприятии.

    Главным акцентом релиза стала работа с кодом, где Qwen 3.6 Plus позиционируется как сильнейшая китайская модель на сегодняшний день. В профильных бенчмарках (SWE-bench и Claw-Eval) она уверенно обходит таких конкурентов, как GLM-5 и Kimi-K2.5, несмотря на то, что они превосходят ее по количеству параметров в 2–3 раза. По уровню автономной разработки Qwen вплотную приблизилась к серии Claude — признанному лидеру в этой области. На практике модель работает как полноценный разработчик: она способна самостоятельно декомпозировать задачи, планировать пути их решения, писать код (от простых фронтенд-задач до изменений на уровне всего репозитория), а также тестировать и исправлять его до полного завершения. Кроме того, Qwen 3.6 Plus “из коробки” совместима с популярными ИИ-агентами, включая OpenClaw, Claude Code и Cline.

    Важным отличием финального релиза стала глубокая мультимодальность. Alibaba реализовала новую архитектурную концепцию «цикла возможностей» (capability loop), которая позволяет модели воспринимать данные, рассуждать и действовать в рамках единого непрерывного процесса. Теперь Qwen 3.6 Plus способна не только обрабатывать текст, но и парсить документы с высокой плотностью информации, анализировать визуальные сцены из физического мира и выстраивать логические цепочки на основе длинных видеороликов. Все эти возможности поддерживаются расширенным контекстным окном, которое вмещает до 1 миллиона токенов.

    Входные данные:
    • Текст
    • Изображения
    • Видео
    Исходящие данные:
    • Текст
  • Логотип Z AI

    GLM 5V Turbo

    Z AI
    Скопировано!

    GLM-5V-Turbo — это первая нативная мультимодальная модель-основа агента от Z.ai, созданная для задач, основанных на зрении и управляемых агентами. Она нативно обрабатывает изображения, видео и текстовые данные, превосходно справляется с планированием на длительный срок, сложным кодированием и выполнением задач, и безупречно взаимодействует с агентами для завершения полного цикла «восприятие → планирование → выполнение».

    Входные данные:
    • Изображения
    • Текст
    • Видео
    Исходящие данные:
    • Текст
  • Логотип Arcee AI

    Trinity Large Thinking

    Arcee AI
    Скопировано!

    Trinity Large Thinking — это мощная модель рассуждений с открытым исходным кодом от команды Arcee AI. Она демонстрирует высокую производительность в PinchBench, агентных нагрузках и задачах на рассуждение. Она бесплатна в open claw в течение первых пяти дней. Видео запуска: https://youtu.be/Gc82AXLa0Rg?si=4RLn6WBz33qT–B7

    Входные данные:
    • Текст
    Исходящие данные:
    • Текст
  • Логотип xAI

    SpaceXAI: Grok 4.20 Multi-Agent

    xAI
    Скопировано!

    Grok 4.20 Multi-Agent — это вариант Grok 4.20 от xAI, разработанный для совместных рабочих процессов на основе агентов. Несколько агентов работают параллельно, чтобы проводить глубокие исследования, координировать использование инструментов и синтезировать информацию в рамках сложных задач.

    Поведение усилий по рассуждению: - низкое / среднее: 4 агента - высокое / очень высокое: 16 агентов

    Входные данные:
    • Текст
    • Изображения
    • Файл
    Исходящие данные:
    • Текст
  • Логотип xAI

    SpaceXAI: Grok 4.20

    xAI
    Скопировано!

    Grok 4.20 — это новая флагманская модель xAI с ведущей в отрасли скоростью и возможностями агентского вызова инструментов. Она сочетает в себе самый низкий уровень галлюцинаций на рынке с строгим соблюдением заданных инструкций, обеспечивая постоянно точные и правдивые ответы.

    Входные данные:
    • Текст
    • Изображения
    • Файл
    Исходящие данные:
    • Текст
  • Логотип Google

    Lyria 3 Pro Preview

    Google
    Скопировано!

    Полноформатные песни оцениваются в 8₽ за песню. Lyria 3 — это семейство моделей генерации музыки от Google, доступное через API Gemini. С помощью Lyria 3 вы можете создавать высококачественное стерео-аудио с частотой 48 кГц из текстовых подсказок или изображений. Эти модели обеспечивают структурную целостность, включая вокал, синхронизированные тексты и полные инструментальные аранжировки. Lyria 3 Pro может генерировать полноформатные песни с куплетами, припевами и бриджами.

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Текст
    • Аудио
  • Логотип Google

    Lyria 3 Clip Preview

    Google
    Скопировано!

    Клипы продолжительностью 30 секунд оцениваются в 4₽ за клип. Lyria 3 — это семейство моделей генерации музыки от Google, доступное через API Gemini. С помощью Lyria 3 можно генерировать высококачественное стерео-аудио с частотой 48 кГц из текстовых подсказок или изображений. Эти модели обеспечивают структурную согласованность, включая вокал, синхронизированные тексты песен и полные инструментальные аранжировки. Lyria 3 Clip может генерировать короткие клипы, петли, превью.

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Текст
    • Аудио
  • Логотип Alibaba

    Wan 2.6

    Alibaba
    Скопировано!

    Самая передовая модель генерации видео от Alibaba, поддерживающая более 10 возможностей визуального создания в единой системе. Wan 2.6 генерирует видео в формате 1080p с частотой 24 кадра в секунду из текста, изображений, референсных видео или аудио, с естественной аудио-визуальной синхронизацией и точным синхронизированием губ. Основные функции включают преобразование референса в видео (вставка внешности и голоса персонажа в новые сцены), многокадровое повествование из простых подсказок, синхронизированные звуковые эффекты и музыку, а также поддержку соотношений сторон 16:9, 9:16 и 1:1 с клипами до 15 секунд.

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Видео
  • Логотип Kwaipilot

    KAT-Coder-Pro V2

    Kwaipilot
    Скопировано!

    KAT-Coder-Pro V2 — это последняя высокопроизводительная модель в серии KAT-Coder от KwaiKAT, разработанная для сложной разработки программного обеспечения корпоративного уровня и интеграции SaaS. Она опирается на агентные возможности кодирования предыдущих версий, с акцентом на крупномасштабные производственные среды, координацию между системами и бесшовную интеграцию в современных программных стэках, а также поддерживает генерацию веб-эстетики для создания посадочных страниц и презентационных материалов производственного уровня.

    Входные данные:
    • Текст
    Исходящие данные:
    • Текст
  • Логотип ByteDance

    Seedance 1.5 Pro

    ByteDance
    Скопировано!

    Модель следующего поколения для аудио-визуальной генерации от ByteDance с архитектурой Dual-Branch Diffusion Transformer на 4,5 миллиарда параметров. Seedance 1.5 Pro генерирует видео и аудио одновременно в одном унифицированном проходе — устраняя проблемы синхронизации при последовательном дубляже аудио. Поддерживает синхронизацию губ на нескольких языках (английский, мандарин, японский, корейский, испанский и другие), кинематографическое управление камерой (панорамирование, наклон, зум, орбита), диалоги с несколькими персонажами и согласованность персонажей в разных кадрах. Производит клипы длительностью от 4 до 12 секунд с разрешением до 1080p. Количество токенов определяется по формуле (высота выходного видео * ширина выходного видео * продолжительность * 24) / 1024.

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Видео
  • Логотип OpenAI

    Sora 2 Pro

    OpenAI
    Скопировано!

    Флагманская модель генерации видео от OpenAI, обеспечивающая видео производственного качества с физически точным движением, синхронизированным звуком и сохранением состояния мира между кадрами. Sora 2 Pro следует сложным инструкциям для многокадровых сцен, сохраняя при этом постоянные пространственные отношения — объекты не исчезают и не меняют форму между кадрами. Поддерживает преобразование текста в видео и изображения в видео с синхронизированными фоновыми звуковыми пейзажами, речью и звуковыми эффектами. Включает усовершенствованную систему безопасности контента с метаданными происхождения C2PA и водяными знаками в стиле SynthID.

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Видео
  • Логотип Google

    Veo 3.1

    Google
    Скопировано!

    Современная модель генерации видео от Google, созданная для максимальной визуальной точности в финальных монтажах. Veo 3.1 генерирует видео высокого качества в разрешении 1080p из текстовых или графических подсказок с нативным синхронизированным звуком — включая диалоги, фоновые эффекты и звуковое сопровождение. Поддерживает расширение сцен (до 20 связанных клипов для повествований длительностью более 140 секунд), переходы от кадров к видео между двумя изображениями, вертикальное видео для Shorts и апскейлинг до 4K.

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Видео
  • Логотип Reka

    Edge

    Reka
    Скопировано!

    Reka Edge — это чрезвычайно эффективная мультимодальная модель зрения и языка с 7 миллиардами параметров, которая принимает на вход изображения/видео и текст, а на выходе генерирует текст. Эта модель оптимизирована специально для обеспечения передовой производительности в понимании изображений, анализе видео, обнаружении объектов и использовании инструментов.

    Входные данные:
    • Изображения
    • Текст
    • Видео
    Исходящие данные:
    • Текст
  • Логотип Reka AI

    Reka Edge

    Reka AI
    Скопировано!

    Reka Edge — это чрезвычайно эффективная мультимодальная модель зрения и языка с 7 миллиардами параметров, которая принимает на вход изображения/видео и текст, а на выходе генерирует текст. Эта модель специально оптимизирована для обеспечения передовой производительности в понимании изображений, анализе видео, обнаружении объектов и использовании инструментов агентами.

    Входные данные:
    • Изображения
    • Текст
    • Видео
    Исходящие данные:
    • Текст